1.6万亿参数的模型,连个“让我想想”都扛不住!
2026年8月13日凌晨,DeepSeek官网API文档悄无声息更新了一行小字——deepseek-v4-pro的指纹从预览版变成了fp_v4pro_20260812。没有发布会,没有CEO出镜,没有“重新定义”的PPT。社区开发者是第一个发现的人,有人在群里甩了一张截图,然后整个群炸了。
但真正让这群人炸毛的,不是参数,不是价格——而是一个诡异到离谱的现象:同一个API端点,同一个模型,在不同会话里,能给你三种完全不同的推理风格。有的回复以“让我”开头,有的以“我们需要”开头,有的干脆啥也不说直接干。更离谱的是,你加一个工具描述、换一个首轮提示词,模型的整个行为轨迹能像开关一样啪地跳过去,中间没有任何过渡。
这就怪了!
一个总参数1.6万亿、单次激活490亿参数的混合专家模型,原生支持100万Token上下文,API最大输出384K,MIT协议开源可商用——这种规格放在2026年8月,是妥妥的第一梯队。知识容量、推理上限、代码能力,官方模型卡写得清清楚楚。那为什么同一个模型,换个接口条件,表现能差出十万八千里?
事情没那么简单!
后训练翻车现场:模型强,但一用就废
DeepSeek V4 Pro正式版在Agent相关评测集上的表现,光看数字确实让人瞳孔放大。DeepSWE从预览版的12.8飙到62.7,涨幅390%;CyberGym从52.7涨到83.3;AutomationBench从12.8涨到31.8。这些测试有一个共同特点:都涉及长链路的代码修改、环境操作和工具调用——恰好是预览版最容易翻车的地方。
但请注意一个细节:官方评测用的是DeepSeek Harness极简模式。什么叫“极简模式”?就是工具schema最精简、首轮条件最干净、没有任何多余干扰的实验室环境。
离开这个环境呢?
社区实验发现,一旦你换掉工具目录、改掉首轮输出条件、或者在系统提示里多塞一行自动注入的内容,模型的推理行为就不是“慢慢变差”——而是直接跳到另一条完全不同的轨迹上。就像你开车时轻踩了一下刹车,结果车子不是减速,而是瞬间切换到了倒挡。
这就牵扯出一个核心概念:能力实现损失(capability-realization loss) 。模型具备的能力,和这些能力能否稳定转化为可交付的任务结果,中间隔着一整条管道——推理模式、首轮接口、工具schema、活动表征、长程状态、验证机制。任何一层发生失配,能力就烂在管子里了。
管道里的第一道坎,就是首轮接口。
Minimal接口依赖症:后训练学了个寂寞?
DeepSeek官方API文档里有个不起眼的细节:在思考模式下,如果同一用户轮次内发生工具调用,相关推理内容需要随工具链正确回传。翻译成人话就是——工具调用的上下文拼接,得你自己搞定,API本身是无状态的。
但问题不在这儿。问题在于,模型在后训练阶段学到的那套高质量Agent行为,跟特定的工具schema、特定的首轮persona、甚至特定的“我们需要”开头是绑死的。
一个叫dsh-anchored-standard的开源项目把这事儿拆得很清楚:官方极简模式下的真实两工具schema,配合默认输出预算,能稳定锚定“我们需要……”这条推理轨迹。但一旦换成标准工具目录,模型立刻跳进“让我……”的风格。如果你再塞一份AGENTS摘要或者可用Skill目录提醒,极简锚定直接失效。
更麻烦的是,一次性开放完整的标准工具目录,还可能产生“晋升后回退”——模型拿到全部工具后反而不知道该用哪个,表现不升反降。
这不是模型“不知道如何工作”。它当然知道。问题是,它学到的“如何工作”是跟特定接口指纹绑定在一起的。脱离这个指纹,策略调用就失灵了。
用大白话说:后训练把模型训练成了一个“在特定考场能考满分、换个考场就懵圈”的考生。
思维链二极管:要么这样,要么那样,中间没有“差不多”
比接口依赖更魔幻的,是行为本身的非连续性。
dsh-routing-standard的精细探测(21个模式点×2次重复,官方API,reasoning_effort=max)发现了一个惊人的规律:沿着persona轴调整模型行为,它不会平滑变化——而是塌缩成三个离散的带。
0到0.19是稳定带——plan-collective轨迹,“我们需要”占主导,“让我”几乎为零。0.2到0.49是过渡陷阱——不稳定混合区,“我们需要”和“让我”来回撕扯。0.5到1.0是另一个稳定带——doer轨迹,“让我”和“他”占主导,“我们需要”几乎为零。而且,后面这个稳定带里,11个不同的模式值表现完全一样。
V4 Flash更极端——0到0.5全在spec一侧,到0.75以上才突然跳过去。
这意味着什么?意味着你对模型的“微调”根本不存在。你以为是旋钮,实际上是个开关。你以为能调到“稍微积极一点”,结果它要么不动,要么直接跳到另一个极端。
开源社区给这个现象起了个名字——思维链二极管(chain-of-thought diode) 。二极管嘛,要么通,要么断,没有中间状态。
但这个比喻有个坑:二极管是硬件缺陷,是制造的时候就没法改的;思维链二极管是行为现象——是后训练没泛化好的结果。它不是DeepSeek官方承认的架构名称,而是社区对黑盒行为的工程概括。
关键问题来了:第一轮形成路径承诺之后,你后面再怎么加persona、再怎么调整提示,基本改不回来了。这叫“路径承诺”——一旦进入某条轨迹,模型就像上了高速公路,没法掉头。
这不是简单的“想得太少”或“想得太多”!问题是没有稳定的任务—轨迹匹配机制,也没有轨迹内部的深度和行动控制。同一个模型,在维护类任务上跑得好好的,换到从零构建任务上就翻车。反过来也一样。
工具接缝和长程漂移:管道里的第二道坑
就算首轮路由对了,长程Agent还会因为另一个问题慢慢烂掉——状态漂移。
DeepSeek官方API文档写得很清楚:API本身无状态,调用端需要正确拼接上下文。这就意味着,在多轮工具调用、文件切换、上下文压缩之后,模型能不能保持同一个任务状态,全靠调用端自己维护。
实际发生的惨状包括:目标在机械执行阶段慢慢淡出;同一个变量名在不同分支被分别重建;工具失败后空白重试,完全不继承失败诊断;旧计划仍占据上下文,却不再是当前行动依据;模型高估完成度,根本没核对目标和验证覆盖。
这就好比你在做一个多步骤的数学题,做到第三步时忘了第一步的条件,然后从头开始算——但上下文里还留着第一步的草稿,你越算越乱。
DeepSeek V4 Pro的1M上下文能装下40万行代码,但这不等于有效工作记忆也有1M。长上下文和有效工作记忆是两码事。Think Max也不等于稳定的长程控制。
J-Space是什么:不是让模型更强,是让模型更稳
2026年7月,Anthropic发表了一项研究《Verbalizable Representations Form a Global Workspace in Language Models》。研究发现,语言模型维护着一组特权的内部表征——可以通过报告访问,但无法直接操控。研究者用一种叫雅可比透镜(Jacobian lens)的新可解释性技术识别了这组表征,并命名为J-space。
J-Space Cognition Suite就是基于这项研究开发的认知增强工具。它不修改模型权重。它通过一套运行协议,控制当前激活内容、维持长任务约束、外化持久状态、识别推理失效。
翻译成人话:它不改变模型脑子里的东西,它改变模型怎么用脑子。
具体怎么做到的?三条核心机制。
第一,功能性第一人称分工。“我”用于感知、判断和承诺;“我们”和“我们需要”用于模型和工作空间共同执行操作;“让我们”用于启动协同动作。这套语法跟高质量的plan-collective轨迹存在结构对应,但不强迫所有任务都变成同一种风格。
第二,三级门控分配控制成本。一眼可核验的单步任务走fast通道,不加载额外机制;有限的多步任务走full通道,只加载一到两个相关模块;多文件、多工具、多轮或需要持久状态的任务走loop通道,启用账本、接缝刷新、checkpoint与恢复。在复杂任务内部,它形成这样的控制序列:局部短判断→行动或取证→必要的深层推理→明确决策→checkpoint→继续执行。
第三,持久状态账本。Loop账本只保留五类任务状态:目标/核心/已验证/未决/下一步。它的作用不是替模型求解,而是让模型在工具调用、文件切换、上下文压缩和长时间间隔之后,能够恢复同一个任务状态。
这正好补充了首轮锚定方案的边界:轨迹进入以后,还需要持续保持、局部换入换出、验证和恢复。
数字说话:Benchmark到底涨了多少
官方API文档公布了DeepSeek V4 Pro正式版在九项Agent基准上的原始成绩。加上J-Space之后的实测结果,对比更直观。
HLE无工具:V4-Pro从42.7涨到48.0;HLE有工具:从60.0涨到67.7。注意,HLE是知识密集型测试,J-Space不创造模型没有的知识,所以无工具条件下的涨幅有限——主要来自结论前的桥接和置信控制。有工具条件下涨幅更大,因为工具接缝和证据整合的空间更大。
Terminal Bench 2.1:V4-Pro从87.9涨到90.1。基础分已经很高,天花板效应明显,增益收窄。
NL2Repo:从61.5涨到73.4。这是代码仓库理解与修改任务,需要需求广播、跨文件一致性和长程状态管理——恰好是J-Space的强项。
CyberGym:从83.3涨到86.8。高基础分下获得中等增益。
DeepSWE:从62.7涨到72.0。这个涨幅值得注意——DeepSWE要求规划与执行交替、迭代验证,对全过程控制高度敏感。
Toolathlon-Verified:从74.1涨到79.5。多工具编排和结果可验证性。
Agents' Last Exam:从25.7涨到30.3。异构任务与模式选择。
AutomationBench:从31.8涨到38.2。持久工作流和依赖推进——但即使加了J-Space,仍低于GLM-5.3的48.2。
效率方面,V4-Flash的得分/时间从0.43提升到1.09,相对增益2.53倍;得分/Token从0.38提升到0.84,相对增益2.21倍。增益不来自压缩答案,而主要来自减少重复重编码、空白重试、长链陷入和从头恢复。
但有个边界必须说清楚:这些是单次实测结果,不是多次均值的置信区间。正式研究需要多随机种子运行和逐任务轨迹日志。
三层方案不是替代关系:入口、路由、持续控制
开源社区围绕DeepSeek V4的“抽风”问题,已经发展出三套不同层级的方案。
第一层,Anchored Standard——精确恢复首轮接口。它的贡献是证明首轮条件具有因果重要性,并把“先进入正确轨迹”与“后续获得完整工具能力”拆开。变量控制明确,启动成本低,避免一次性倾倒完整工具目录。但它的边界也很明确:依赖DeepSeek Harness具体版本和工具装配;零工具锚定还可能在恢复工具后回到另一条轨迹。
第二层,Routing Suite——任务感知的外部模式选择。它识别spec/react/mixed/weak行为区,根据Pro与Flash使用不同persona。公开摘要报告了维护任务与构建任务的模式差异,以及黑洞式推理从58K缩短到27K、同时保持行动完成的结果。但它仍主要围绕首轮模式和外部分类器展开;路由错误会直接选择错误行为带。
第三层,J-Space——持续轨迹维持与全过程控制。首轮接口恢复上不如Anchored Standard直接;行为带选择上不如Routing Suite专门。但它的优势在于:功能性回响加接缝审计维持轨迹;fast/full/loop加分段控制调节推理深度;Goal/Core/Verified/Open/Next维持持久状态;verifier加coverage加done-check覆盖验证;标记、诊断重试、Empirics、resume覆盖失败恢复;跨平台与跨模型覆盖更广。
最合理的关系不是“一个淘汰另外两个”,而是三个不同层次:Anchored Standard负责入口条件,Routing Suite负责模式选择,J-Space负责进入之后的持续计算治理。
短任务或只需要恢复Minimal接口时,前两者更轻、更直接。长程、多工具、多文件和高验证风险任务中,J-Space的系统覆盖更有优势。
两个未解的实验细节
第一个细节。DeepSeek V4 Pro在HLE无工具条件下加了J-Space是48.0,仍低于Fable 5的53.3。但HLE有工具条件下,V4-Pro加J-Space是67.7,超过了Fable 5的63.0。同一个模型,同一个插件,在知识型任务上打不过,在工具型任务上打得过。这说明什么?说明瓶颈的位置不一样——知识边界靠插件补不了,但工具接缝和验证控制能补。可如果瓶颈可以这么精准地定位,那其他benchmark上的差距,到底哪些是知识边界,哪些是控制损失?
第二个细节。AutomationBench上,V4-Pro加J-Space是38.2,GLM-5.3是48.2。差了整整10分。但DeepSWE上,V4-Pro加J-Space是72.0,GLM-5.2只有46.2。同一个插件,在A任务上追不上竞品,在B任务上甩开竞品。如果J-Space的机制是通用的——工作空间加载、选择性路由、持久账本、验证恢复——那为什么效果在不同任务上差异这么大?是任务本身的结构差异,还是评测条件的不同,还是J-Space的某个模块在AutomationBench上根本没被正确触发?
这两个问题,目前没人给答案。
DeepSeek V4 Pro正式版已经上线,Harness开发者预览版已经开放。模型规格没变,价格没涨。但那个“同一个端点三种行为”的现象还在。J-Space能缓解一部分,但不能解决全部。
如果你现在去调用deepseek-v4-pro的API,temperature=1.0,top_p=0.95,reasoning_effort=max——你得到的是“我们需要”还是“让我”?取决于你今天运气好不好。
这事儿,还没完。
网友灌水
1、听起来有点像胡说八道,但据说这款 J-space 技能插件可以提高基准测试分数:
https://github.com/Tiger3807861189/J-Space-Cognition-Suite-V3.6
2、挺有意思的,但我认为结构化封装实际上并不能做到任何手动操作做不到的事情,而且它很可能会比以前更消耗你的 API,因为它会不断地尝试纠正错误并调整模型。在这种情况下,最好还是等待新模型,省下你的积分吧,哈哈。