2026年7月19号凌晨,一位叫Leo的推特用户发布了一份技术调查,在AI圈引发广泛讨论。Leo指出,DeepSeek V4在官方API接口处理复杂代码任务时,输出的结果与Claude Fable 5之间存在高度一致性。这不是常规的训练数据重叠,而是API输出层面的深度相似。本篇文章基于Leo的调查报告梳理输出相似疑云,拆解思维链结构差异、分类器回退表现和动态路由逻辑,探讨模型服务与知识产权的边界问题。
Leo的OpenCode测试揭示输出高度一致性
事情引起关注的开端在OpenCode这个开发平台。Leo和他的团队在太平洋时间早上7点到8点之间,用DeepSeek的官方API对接V4模型进行了一组对照测试。当输入只有简单数学题或者常识问答时,V4的回答符合其宣称的2025年5月知识截止日期,思维链结构也是DeepSeek系列模型常见的详细逐步推理风格。
但在Leo把3D射箭游戏代码需求加入测试组合时,同样模型在同样API通道下的输出内容出现了明显变化。Leo贴出的代码对比显示,DeepSeek V4生成的游戏HTML结构、变量命名规则、注释行文习惯,与Claude Fable 5的输出存在高度相似。这种相似度超出了常见开源代码模板的共享范围,更像是同一套执行逻辑在产生结果。
Leo的测试中有一个关键转折出现在混合提示词环节。当3D游戏代码需求与网络攻击或生物相关的问题捆绑输入时,输出质量显著下降,模型回答又退回V4的知识截止到2025年5月的状态。Leo记录的切换模式呈现出一个规律:纯代码类复杂请求的产出与Fable高度相似,而涉及特定安全敏感话题的组合请求则表现出不同的处理路径。
Leo对比思维链风格发现生成路径差异
推理过程也叫思维链,是大模型在输出最终答案前的内部推理步骤记录。不同模型的思维链有各自的语言习惯和结构特征,像书写笔迹一样具有辨识度。
DeepSeek系列模型通常采用分步拆解的方式,每一步都做明确标注,整体语气偏技术文档风格;Claude Fable 5的思维链则更倾向于一次性规划整体方案,语言流畅度更高,逻辑衔接更自然。
Leo在调查记录中指出,当V4输出与Fable高度相似的3D游戏代码时,伴随的推理过程风格也同步变化,更接近Fable的习惯特征。而当请求退回V4原生状态时,思维链又恢复成DeepSeek自己的风格。Leo认为这种同步切换说明产出相似的可能不只是最终代码,而是从推理到输出的完整生成路径都经过不同处理。
Leo的观察引发多位技术社区开发者加入讨论。他们在回复中提到自己在使用DeepSeek API时偶尔也会遇到响应时间波动,或者部分调试信息返回异常值。Leo强调这些现象只在使用特定API通道和特定提示词模板的组合下才稳定重现,并且在调查窗口结束后DeepSeek方面似乎对路由系统做了一些调整,后续的行为模式出现了变化。
Leo设计的分类器触发实验提供关键观察窗口
分类器是模型服务商内置的内容安全过滤模块,用来拦截涉及网络安全、生物危害、极端暴力等敏感话题的请求。每个主流模型都有自己的分类器规则体系,触发后的拒绝方式也各有特点。Leo设计了一个对比逻辑:在3D游戏代码请求中嵌入网络或生物相关关键词,让混合内容同时触及游戏需求和分类器审查。
Leo的测试结果显示,混合请求的输出质量普遍偏低,连基础的游戏功能都完成得不完整。这种连带质量下降的现象,与纯净3D游戏请求的高质量输出形成鲜明对照。Leo在分析中指出,这种模式可能反映了不同处理路径被激活后产生的不同结果:带敏感内容的请求在经过分类器审查流程后输出能力受限,而不带敏感内容的纯代码请求则输出了高质量结果。
Leo的调查还提到一个细节:他们确认所选的网络生物问题确实会触发Fable的分类器。这个细节让整个观察的对照逻辑更加完整。有评论提出这种切换模式也可能是模型内部不同专家模块的调用差异,但Leo回应说同时发生思维链风格切换和输出质量变化的组合现象,比单一指标的变化更难用巧合解释。
Leo的调查引发模型评估体系透明化讨论
Leo的报告发布后引发的一个核心话题是模型输出的真实性验证。如果API返回的内容不一定来自预期模型的处理流程,那么基于API输出做的能力评估、性能比较都可能失去参考基准。这不是针对单一服务商的疑问,而是对整个行业API服务透明度的普遍关注。
多位技术观察者在Leo的帖子下展开讨论,指出模型路由系统本身是行业常见的工程手段,很多大型服务商都会根据请求复杂度、负载情况、用户等级做动态调度。关键在于这种调度是否透明告知用户,以及在评估和排名场景中是否公允。如果用户以为自己在使用A模型却实际获得了B模型的输出能力,那所有的性价比计算都建立在模糊的地基上。
Leo在回复中表示愿意开放测试方法供社区复现。这种态度有助于推动讨论向技术验证方向演进。也有评论认为这次讨论如果推动行业建立更清晰的输出溯源和归因机制,对整个生态反而是好事。截至讨论发酵时,DeepSeek官方尚未对此事做出公开回应,社区中不少声音希望给技术团队留出分析解释的时间。
输出相似度的技术解释与行业边界讨论
整个事件最广泛的讨论集中在两个层面:模型输出高度相似的技术解释,以及AI服务商之间借用彼此输出能力的行业惯例。代码生成领域本身就有大量共享的开源基础库和公开技术文档,顶尖模型在标准任务上的答案趋近并不罕见。真正的技术挑战在于如何建立可验证的方法来区分正常趋同与非正常引用。
Leo的调查因为提供了可复现的操作步骤和多角度的对照观察,在技术社区获得了不少认可。同时也有声音指出,两个经过相同高质量代码数据集训练的模型,在常见编程任务上的产出趋同是统计学上可能的结果。要确认真实原因,需要更精细的实验设计来排除巧合,也需要更多第三方独立复现来交叉验证。
对于普通使用者来说,关注点也许很简单:代码好用、价格合适就行。但对于AI评估体系和技术市场的长期健康来说,搞清楚每次API调用到底是谁在处理,是必须跨过去的一道坎。Leo的这份调查无论是作为技术讨论的起点还是作为验证方法论的示范,都已经把API服务透明度和模型身份验证这两个问题推到了聚光灯下。