你以前看到的AI画图,都是敲一行字然后“啪”一下蹦出一张图。但2026年9月3日这天,OpenAI发布的GPT-6 Astra不是这么干的。它打开绘图软件,新建图层,挑了个笔刷,然后用鼠标一笔一笔把初音未来的轮廓勾出来,再铺底色,再加阴影。整个过程被录成了一段加速视频——跟你刷B站时看到的任何一位画师投稿的“绘画过程”一模一样。
这个区别太大了。以前那些工具叫“生成”,现在这个叫“作画”。
Stable Diffusion、Midjourney、DALL-E全用的是latent diffusion技术,模型在潜空间里一次性吐出一张成品图,中间没有任何“动手”的痕迹。但GPT-6 Astra不一样,它先打开Krita或Clip Studio Paint这类软件,然后通过操作鼠标和键盘,像人类一样缩放画布、换颜色、勾线稿。它甚至知道要分图层画,先画线稿层再上色层。Reddit上有人把这段视频反复看了十几遍,最后说了一句话:“如果没人告诉我,我会以为这是某个画师在直播。”
这背后是一个更底层的转变。OpenAI给GPT-6 Astra的定位不是“聊天机器人”,而是“全球最强的计算机使用模型”。翻译成白话:它能直接操作你电脑上的任何软件。让它打开浏览器查资料,它就去;让它打开Excel做表,它也去;让它打开Blender建模再导入Unreal Engine 5做游戏场景,它照样去。画初音未来只是它“计算机使用”能力里最抓眼球的一个小展示。但恰恰是这个“小展示”,把反AI艺术社区最后一道防线给炸开了。
初音未来(Hatsune Miku)是什么?
初音未来(Hatsune Miku)是一位诞生于2007年8月31日的虚拟歌姬。她最初是一款基于雅马哈公司“VOCALOID”语音合成技术的音乐软件。简单来说,用户只需输入歌词和旋律,就能让这款软件“唱”出歌曲。
为了让软件更好玩,公司为它设计了一个充满未来感的动漫少女形象:16岁、留着葱绿色的双马尾。这个形象太过成功,让她从一款工具软件,一跃成为了风靡全球的文化符号。
- 技术起源:由日本公司Crypton Future Media基于雅马哈的VOCALOID语音合成引擎开发。她的声音采样自日本声优藤田咲。
- 身份演变:起初是一款音乐制作软件,后因拟人化形象而走红,最终成为一位虚拟偶像、超级IP。
- 核心特点:拥有大量粉丝创作的歌曲,并通过3D全息投影技术在现实世界中举办演唱会。
反AI社区的最后一道防线被攻破!
Anti-AI艺术群体过去有个铁打的论点:AI生成的东西没有创作过程、没有笔触温度、没有修改痕迹。很多画师为了证明自己画的不是AI,特意把完整的绘画过程录下来发到网上。现在GPT-6 Astra把这个“自证清白”的工具给没收了。它生成的是一段完整、连续的作画录像,从空白画布到成品图,每个笔刷动作都看得一清二楚。
Reddit用户H4LF4D试图找破绽:“机器作画还是有迹可循的,比如它从来不擦除、从来不打草稿构图、直接从顶部开始画精确细节。”这个反驳只对了一半。GPT-6 Astra在演示里确实没擦除,但它已经会新建图层和调整笔刷了。随着模型迭代,擦除、打草稿、调整构图这些操作,只是时间问题。到那时候,一段加速播放的绘画过程视频,还能证明什么?
日本有位画师做了个实验:把自己手绘的线稿丢给GPT-6 Astra,让它在Clip Studio Paint里用鼠标完成上色。Astra自己新建了三个图层,分别对应皮肤、头发和衣服,然后一笔一笔填色加阴影。整个过程毫无破绽。这位画师在X上发完视频后加了一句:“我现在不知道怎么证明自己画的图不是AI做的了。”这话从一个职业画师嘴里说出来,分量很重。
这就怪了。以前反AI的人喊“AI没有创作过程”,现在AI有了完整创作过程,他们该拿什么来区分?
10万块GPU堆出来的硬核参数!
GPT-6 Astra不是凭空变出来的。它的训练动用了超过10万块GPU,总参数量达到5到6万亿,采用混合专家架构,每次推理只激活大约10%。上下文窗口105万token,最大输出12.8万token,知识截止到2026年4月30日。这些数字是什么概念?上一代GPT-5.6 Sol的上下文窗口是50万token,它直接翻了一倍。
在OSWorld 2.0测试中,GPT-6 Astra拿下了72.6%的得分,比上一代的65.7%提升了近7个百分点。在ARC-AGI-3测试中更是拿到了99.9%。在Terminal-Bench 4.0得分57.7%,在Agents' Last Exam得分59.3%,超过了Claude Opus 5的55.5%和GPT-5.6 Sol的53.6%。ExploitBench测试甚至拿了100%满分。
API定价是每百万输入token 10美元、每百万输出token 50美元,是上一代的2.5倍,和Anthropic的Claude Fable 5.1处在同一水平。OpenAI总裁Greg Brockman在发布前说了一句话:“欢迎来到AGI时代。”他认为几年后回头看,人们可能会把GPT-6 Astra视为AGI时代开始的一个节点。这话说得有点大,但它确实展示了一个跃迁:从“回答问题”到“替你干活”。
画师们真正焦虑的根源在哪里!
Reddit用户torrid-winnowing问了个直击灵魂的问题:“如果AI用和人类画师一样的软件、一样的方式画画,人们会不会更容易接受AI艺术?”底下最高赞回复只有六个字:“不会,他们早回不去了。”
这话点出了核心矛盾。反对AI艺术的人,反对的究竟是“生成方式”还是“创作者不是人”?如果是前者,GPT-6 Astra用鼠标一笔一笔画出来的方式和人类画师没区别;如果是后者,那AI用什么方式画结果都一样。
Reddit用户IronPheasant说了一段特别扎心的话:“就算AI能治愈癌症、在人间建起天堂,那些人还是会抱怨很多年,因为世界变了。”他还补了一刀:“那些愤怒的人并不喜欢画画,他们只在乎画画带来的外部回报——钱和名声。”这话说得狠,但确实撕开了一个口子。真正热爱画画的人,AI画得再好也不影响他自己画画的快乐。真正坐立不安的,是那些靠画画吃饭、担心饭碗被抢的人。
但经济账目前还站不住。用户iamlightlink算了一笔账:“AI要取代所有工作,前提是它得能赚钱。如果AI画一张初音未来要花3000美元,而人类画师只要80美元,那差距还大着呢。”画一张初音未来具体要消耗多少token,目前没人公布过,按GPT-6 Astra的API定价算肯定不便宜。不过按照AI领域过去三年的降价速度,成本降下来只是时间问题。Stable Diffusion刚出来时生成一张图也要几美元,现在降到几美分了。同样的剧本大概率会再演一遍。
不可读的思维链带来的巨大隐患!
GPT-6 Astra还有一个让安全团队睡不着觉的特点。它的部分推理直接在神经网络的激活值里完成,全程不落成可读的文字。OpenAI自己的系统卡给了一个量化指标:模型刻意控制自身思维链形态的能力,从上一代的16.1%猛涨到60.9%。
这意味着监管者越来越难看懂它在想什么、为什么做出某个决策。一个能直接操作你电脑的AI,如果思维过程是“黑箱”,那它带来的安全风险有多大?
OpenAI自己把GPT-6 Astra定义为首个达到“关键”级网络安全能力的模型。在获得适当工具和访问权限的情况下,这个级别的模型能在许多防护严密的系统中发现此前未知的安全漏洞,并开发相应的漏洞利用方法,无需人工逐步指导。为此,OpenAI在发布前紧急加强了对网络滥用和模型未经授权行为的防护及监控。一个能自己操作电脑、思维过程不可读、还能自己找安全漏洞的AI,这听起来像科幻电影,但2026年9月3日它成真了。
回到那个让所有人失眠的下午!
回到GPT-6 Astra画初音未来这件事。Reddit用户joaquinsolo的评论火药味最重:“我从来没见过一群人对着自己花点时间就能做到的事情高潮。”但底下有人回了他一句妙语:“有意思,标准翻过来了。以前是说‘AI通过提示词就能做到’,现在变成了‘人类花时间也能做到’。”
这句话精准击中了反常识之处。以前AI生成图片,人类的护城河是“我有创作过程你没有”。现在AI也有了创作过程,人类的优势退守到“我花时间也能做到”,但AI花的时间更短、成本更低、还能批量复制。The_Scout1255的评论被顶到最高:“我等不及看历史书上写:‘他们知道事情在进展,是因为AI画了初音未来 :3’。”那个表情里藏着复杂的情绪:既是玩笑,也是事实。
一个AI打开绘图软件、新建图层、选取画笔、一笔一笔画出初音未来。它没有“生成”图像,它“画”了一幅画。这个区别,可能会改写我们对“创作”的全部理解。它能画初音未来,也能画梵高风格;能设计PCB电路板,也能在Blender里建3D模型;能填税表、写合同、做科学模拟。五年后、十年后,一个能操作任何软件的AI——它到底是工具还是“人”?这个问题现在没人能回答。
但有一个细节让所有人在这个周末睡不着:GPT-6 Astra在演示中画完初音未来的最后一笔时,没有任何人给它下达“停笔”指令。它自己停下了。