• 真正的智能不来自更聪明的推理,而来自更诚实的context感知。 GPT-5.6 Sol在ARC-AGI-3基准测试中平均得分7.78%,看似惨淡,却拿下了一个几乎所有AI模型都无能为力的公共游戏ft09的87%正确率。这个矛盾揭示了一个关键转变:新一代大语言模型正在从“解题机器”进化为“环境Con
  • 八个主流大语言模型同答一道概率陷阱题,全对但思考路径天差地别。GLM5.2几乎零自我怀疑直接交卷,DeepSeekV4Pro自我修正十余次,Gemma31B只拐两三个弯。思维树可视化把每个“但是”“等等”变成树杈,AI决策过程首次肉眼可见,大模型对比评测揭示推理模式本质差异。 可视化工具把AI思考过
  • DeepSeek创始人梁文锋在近期一场四小时投资人会议上爆出52条金句,明确拒绝短期商业化、用户增长和超级应用,坚持开源、低成本与AGI优先。本文拆解其语言策略、技术路径与组织逻辑,呈现这家中国AI实验室如何用“克制”反制市场预期,以及它对中美AI差距、模型竞争、团队稳定性的底层判断。 1. Dee icon
  • 2026年造个百万行代码的产品,零行人工手写,三个月干完,凭啥? OpenAI内部团队搞了个狠活:从空的Git仓库起步,五个月堆出百万行代码,全靠Codex智能体,人类一个字符没敲。这篇东西不是讲AI写代码多快,而是讲怎么给AI搭个笼子让它不乱飞。 这套方法叫Harness Engineering, icon
  • GPT‑5.6 来了,但你可能根本用不上! OpenAI 正式发布了 GPT-5.6 系列的预览版:Sol、Earth 和 Luna,宣称是“下一代模型”,但细看公告发现这玩意首发只给美国政府批准的“可信合作伙伴”。普通用户连摸都摸不到。更离谱的是,他们搞了个750 tokens/秒的极速版,但只给 icon
  • AI自己搞科研,比人类还卷,这上哪说理去。 最近OpenAI放了个消息出来,他们内部搞了个新模型GPT-5.6,说是目前最能帮研究员加速AI研究的东西。以前大家觉得AI顶多写个邮件、做个摘要,结果人家现在干的是正儿八经的科研活儿。诊断训练故障、优化系统架构、设计实验方案、解读数据结果,研究员从头到尾 icon
  • 微调你的大模型?不,是让它自己卷死自己。 2026年微调大模型早已不是烧钱游戏,开源小模型通过强化学习直接干翻闭源巨无霸。GRPO算法、RULER自动评分、ART框架让AI在试错中进化,省去手动标注和奖励函数。关键是在监督微调的战略定力与强化学习的战术创新之间找到致命平衡,否则要么变书呆子要么变疯狗 icon
  • 所有早期测试人员、OpenAI 研究人员以及 Sam Altman 本人都一致认为,GPT-5.6 是迄今为止在数学、网络安全、生物学以及递归自我改进领域取得的最重大突破……距离正式发布仅剩 36-60 小时! 这回在Reddit上炸开锅的这事儿,好像真有点不一样。OpenAI那帮最早拿到测试资格的 icon
  • 数学从来不是靠逻辑严谨赢的。 2025年7月,OpenAI用一个大语言模型,在没用到任何数学专用工具的情况下,直接拿下了国际数学奥林匹克竞赛金牌。而在一年前,DeepMind的AlphaProof为了同样的金牌,用掉了几百个TPU天的算力,每个问题还得单独训练两三天。一个连证明步骤都不用检查的通用聊 icon
  • Jelani Nelson 这种顶尖算法大神,放着UC Berkeley EECS系主任不干,跑去 Anthropic 搞 AGI 了。他那个哈佛公开课有1000多万播放量,现在直接“叛变”学术界加入工业界,这事儿挺有意思的。硅谷招人的逻辑变了,不仅看论文,还要看你能不能把理论变成炸掉世界的玩意儿。 icon
  • 如果你觉得AI能自己进化,那你可能还没见过它把自己绕进死胡同的样子。 自助进化智能体正成为AI圈最火的概念,但三类系统进化的对象完全不同。本文拆解制品迭代优化、harness自我改进和模型自学习三大方向,帮你分清哪些是真进化,哪些只是换了个酷炫的名字。 自助进化智能体到底进化的是什么东西 icon
  • OpenAI 将 GPT-5.6 以有限预览版的形式发布,而不是公开发布。Sam Altman 告诉员工,这是政府的要求,OpenAI 将“在预览期内逐个批准客户的访问权限”。 Anthropic 公司四月份也用 icon
  • 几个硅谷大佬凑了十亿美金,做了一个AI,结果它生成的视频里,咖啡杯直接从桌上飘起来了。 世界模型被吹成AI的下一个革命,但连专家自己都说不清这玩意儿到底能干啥。本文用一个三分法帮你拆开看:盆景派、直播派、玄学派。三条路互相打架,谁也没干过谁。机器人没数据练、算力贵到离谱、AI看视频能不能学会物理,全 icon
  • 真正改变AI未来的力量,可能藏在服务器机房,而不是发布会舞台。 Anthropic正在通过人才布局、计算基础设施和企业生态建设,打造一种新的AI竞争模式。AI大模型竞争已经从单纯算法突破进入智能生产体系竞争,计算资源、研发自动化和商业落地正在共同形成AI时代的智能生产飞轮。 Anthropic重 icon
  • 如果你发现GPT-5.6在某个任务上翻车了,OpenAI说他们会专门为你这个任务搞个强化学习环境来解决。这操作,就像你去饭店说菜不好吃,大厨直接为你开个小灶单独炒一份。 感觉这是把用户痛点直接变训练题了 最近OpenAI的老大Greg发了一封邮件,说如果你发现GPT-5.6在某个任务上效果不行,直接 icon
  • 老板逼员工狂烧AI额度?真相竟然是为了逼大家学新技能!现在烧钱逻辑全变了! 老板们催员工狂用AI,表面看是犯傻烧钱,但实际上这是他们故意搞的一场“全员AI大练兵”。现在成本暴涨,补贴停了,大家觉得烧钱时代结束。但最新的技术趋势是,AI花越多心思(token)干活,结果就越好,这反而会催生新一轮更猛烈 icon
  • 当你发现邻居家孩子突然从一米六长到一米八,你第一反应肯定不是"哇他好高",而是"这哥们儿昨晚偷偷吃了什么"。 AI圈最近就处在这么一种状态。一个代号叫GPT-6的新模型据说马上就要杀出来了,训练参数直奔10万亿级别,上下文窗口能干到150万token。但有意思的是,爆料人说这东西在超过25万到50万 icon
  • 埃德·威滕(当今最伟大的物理学家)在最近的一篇论文中引用了Claude理论。 量子引力论文里藏了个脚注,Claude帮忙干了件特别费手的事。按物理学家Witten自己的说法,他把几个特例之外的推广全丢给了大模型。媒体激动坏了,但真正搞笑的是,Claude做的不是发现新物理,而是像个给公式做牛马的研究 icon