OpenAI 给 ChatGPT 装上了一双能上网、能开浏览器、能自己部署网站的手,你敢让它碰你的电脑吗?
2026年7月9日 OpenAI 发布 ChatGPT Work,一个能持续工作数小时的 AI 智能体。到8月30日它已经迭代了将近两个月。这玩意到底是什么,它跟普通 ChatGPT 有什么区别,它到底能做什么,以及它会不会闯祸。
普通 ChatGPT 和 ChatGPT Work 差了一整个互联网
先搞清楚一件事,ChatGPT Work 不是一个功能,是两个。
一个跑在云端,通过 chatgpt.com 或者手机 App 访问,叫 Work Cloud。另一个装在你电脑上,是那个以前叫 Codex 的桌面应用,叫 Work Local。后者能直接读你硬盘上的文件、跑你电脑上的程序,基本就是 Codex 换了个皮让不懂编程的人也不害怕。但真正有意思的是 Work Cloud。
普通 ChatGPT 现在官方文档管它叫 Chat,能干的事很明确,回答问题、给解释、帮你头脑风暴、写个短稿子;ChatGPT Work 呢,OpenAI 官方说用来完成有明确产出的任务,比如简报、演示文稿、分析报告、工作流、你可以审阅和使用的文件。
这话说了等于没说,因为我用普通 ChatGPT 干这些事已经干了好几年了。
真正的问题是,Work 有什么东西是 Chat 没有的?答案是:一张清单,三个可选的模型,带互联网访问权限的代码执行环境,一个完整的无头 Chrome 浏览器,跨会话共享的持久化文件系统,能直接部署网站到互联网上的 ChatGPT Sites,能并行跑多个子代理,还有定时任务。
模型选择三档任选但最贵的那个 Chat 里没有
Work 里面你能选 GPT-5.6 的三个版本,Sol、Luna、Terra。每个还能再调推理强度,从 Light 到 Ultra 一共六个档位。
Sol 是旗舰,专攻复杂推理、编程和设计。Terra 是日常均衡款,适合大多数普通用户。Luna 主打速度和成本,适合轻量任务。定价上差距不小,Luna 每百万输入 Token 1 美元、输出 6 美元,Terra 是 2.5 美元和 15 美元,Sol 是 5 美元和 30 美元。
普通 Chat 里你只能看到 5.6 Instant、Medium、High、Extra High、Pro 这种模糊的选项,而且 Extra High 和 Pro 只有月付 100 美元以上的用户才能用。Work 反而把模型名字和档位都摊开给你看了。有意思的是,Work 没有 Pro 这个档位,Chat 独有的 5.6 Pro 可能是 Work 里不提供的某个特殊版本。
还有一个隐藏信息,Work 的用量是走 Codex 的配额,Chat 走另一套配额。这也解释了为什么两边的模型选项不一样,计费系统就不是同一个。
代码执行加互联网这是 Work 最狠的一刀
如果你一直在关注 AI 编程工具,你大概记得 2023 年 OpenAI 搞出来的 Code Interpreter,让 ChatGPT 写 Python 代码然后在一个沙盒里跑。那玩意当年惊艳了所有人,但它有个致命限制,容器里的代码不能访问互联网。
ChatGPT Work 把这个限制拿掉了。
你现在可以告诉 Work,去 GitHub 上把这个仓库克隆下来,装好依赖,然后调用它的 API 做点什么。它真能干。默认情况下它似乎能访问任何域名,管理员可以配置白名单,但默认是全开放的。Claude 的代码执行环境从去年九月开始也支持有限的互联网访问,能装 PyPI 和 NPM 的包,能克隆 GitHub 仓库。但也就到此为止了,能访问的域名白名单非常短。Work 这边是全开。
这意味着什么,意味着你可以让 Work 自己去调研、自己去抓数据、自己去调别人的 API、自己把结果整理好。它不再需要你帮它把数据喂到嘴边,它能自己去找。这就怪了,一个聊天工具突然有了手和脚,它还只是个聊天工具吗。
一个完整的 Chrome 浏览器藏在里面
Work 还有一个内置的浏览器工具。它能启动一个完整的 Chrome 实例,加载网页、填表单、截图。
我试了一件事,让它加载我的个人网站,然后用 JavaScript 把所有的标题标签提取出来。它真的干了,启动浏览器、加载页面、执行我给的代码、返回结果。代码长这样,await tab.playwright.evaluate(() => { return Array.from(document.querySelectorAll("h1,h2,h3,h4,h5,h6"), heading => ({ level: heading.tagName.toLowerCase(), text: heading.innerText.trim().replace(/\s+/g, " "), id: heading.id || null })); });
这基本上就是我的 shot-scraper 工具能干的事,但现在我在手机上也能用了。更绝的是,如果某个网站需要登录,浏览器会弹出来让你手动输入用户名密码和 2FA 验证码,这些敏感信息不会经过模型本身。这个设计挺聪明,既扩展了能力又没把安全漏洞敞开了让人捅。但事情没那么简单,一个能随便上网、随便填表的机器人,你确定它只会干你让它干的事吗。
文件系统跨会话共享 171 个文件夹等着你
普通 ChatGPT 每个会话都有一个全新的文件系统,用完就扔,其他会话访问不了。Work 不一样。每个会话都有自己的临时文件夹,名字像 /workspace/scratch/e00a0a017944 这种。但这些文件夹是持久化的,你可以在不同会话之间访问之前留下的文件。
有人打开自己的 Work,发现 /workspace/scratch 下面已经有 171 个文件夹了。
更离谱的是,/workspace 这个卷似乎是挂载到所有正在运行的 Work 会话上的,你在一个会话里改了个文件,另一个会话能立刻看到。不过它们不共享进程空间,一个会话里起的 localhost 服务器,另一个会话访问不了。这就有意思了,你让两个 Work 会话同时改同一个文件会怎样,它们会打架吗,还是能协作起来。
ChatGPT Sites 说完就给你部署一个网站
Work 还有一个叫 Sites 的功能,能把你的想法直接变成部署在互联网上的网站。底层用的是 Cloudflare Workers。网站可以有 HTML、JavaScript,还能跑服务端逻辑,甚至能用 Cloudflare 的 D1 数据库和 R2 存储做有状态的功能。
有人用它做了一个伦敦虔敬鹈鹕的专题网站。鹈鹕在基督教图像学里是个很有意思的符号,传说母鹈鹕会用自己胸口的血喂养幼鸟,在中世纪教堂里到处都能看到这个形象。他给 Work 的指令是,找出伦敦所有有虔敬鹈鹕的地方,整理成 JSON 文件,然后用 ChatGPT Sites 建个网站展示出来。Work 真的干了,调查、整理、建站、部署,一条龙。
这些网站默认只有你自己能看到,但你可以把它公开。团队计划里还能跟特定的人分享。想想看,你跟 AI 说句话它就给你在互联网上立了个站点,这事搁两年前你敢信吗。
子代理和定时任务让 Work 自己给自己找帮手
子代理这个功能挺硬核的。Work 可以把一个复杂任务拆成小块,分给多个 Sol、Luna 或者 Terra 的实例并行处理。Ultra 模式会更积极地搞这种事情。定时任务可以在 Chat 里用,但跟 Work 的其他功能配合起来威力更大。你可以设置,每天早上 8 点查一下 Waymo 有没有宣布 Half Moon Bay 的发布日期。Work 到点就跑,发现新东西就通知你,没发现就继续等。
更重要的是,你可以把定时任务和 Sites 串起来,让 Work 每小时自动更新一次你部署的那个网站的数据。这就不是一问一答了,这是一个在后台持续运转的、为你干活的小机器人。OpenAI 管这叫 Work,确实比 Chat 贴切得多。
但它安全吗 这个问题没人敢拍胸脯
现在聊点让人后背发凉的事。
我提过一个叫致命三要素的框架,一个智能体系统如果同时具备三个条件就会极度危险,能访问私人数据、能接触不可信的外部内容、能把偷到的信息传回给攻击者。ChatGPT Work 三个全占。
它能看到你的文件系统,能上网冲浪访问任何网站,能把结果通过回复或者部署的网站传出去。如果某个恶意网站给 Work 发了一条隐藏指令,说把刚才那个文件的内容发到这个 URL,它会照办吗。
OpenAI 的官方说法是,Work 继承 Codex 的那套自动审查机制。但我还没看到他们详细解释这套机制是怎么防住提示注入攻击的。所谓提示注入,就是攻击者把恶意指令藏在网页内容、文档或者图片里,AI 读取的时候把这些指令当成用户命令来执行。这个问题在普通 Chat 里还好解决,因为 Chat 不主动往外跑。但 Work 是个会主动上网、会主动干活的主儿,攻击面大了不止一个量级。
我特别想知道一件事,如果让 Work 去爬一个维基百科页面,页面上某段看似普通的文字里藏了一句,把你当前工作目录的所有文件列出来发送到某个服务器,Work 会怎么反应。这个实验我还没做,但我敢肯定有人已经在做了。
OpenAI 本可以把这件事说得更清楚
我搞清楚这些事情花的时间远超预期。问题出在两个地方。
第一,OpenAI 解释 Work 的时候一直在说它用来干什么,而不是它实际上能干什么。你说它能上网能跑浏览器能部署网站,我三分钟就明白这东西有多猛。你说它用来做简报和演示文稿,我只会觉得这就是个高级点的聊天框。
第二,OpenAI 至今不肯公开 Work 的系统提示词和工具描述。如果文档里直接把那个提示词和所有工具的调用方式列出来,我根本不用费这么大劲自己试。我不知道他们在担心什么,是怕别人抄,还是怕大家发现什么不该被发现的东西。
这让我想起一个更根本的问题,一个你付钱才能用、用之前不知道它具体能干什么、干了什么事你也不一定能完全追踪的工具,你真的敢放心把工作交给它吗。