DeepSeek V4.1 Flash实测崩盘:10天聊天质量掉10分,编程之外全塌方

一款主打便宜好用的国产大模型,刚更新完就被自家用户骂上了热搜!

十天里聊天质量掉了十分,你敢信?

九月中旬,深度求索(DeepSeek)推送v4.1 Flash版本更新,一家长期采购其接口的聊天平台运营方,甩出了跨越十天、覆盖数十亿token的对照实测数据,直指新版本在创作、连贯、状态管理三条主线全面滑坡,编程之外几乎全线塌方,本文拆解这份实测账单。

跑分屠榜却在聊天时翻车

Codeforces竞赛编程评级冲到3471分,直接把上一代旗舰V4 Pro的3348分按在地上摩擦,Codeforces是一个全球程序员在线打算法比赛的天梯平台,分数越高说明AI解算法题越牛。Terminal-Bench终端任务测试拿下90.6分,比V4 Pro高出将近3分,这个测试衡量的是AI在命令行环境里独立完成编码任务的能力。DeepSWE软件工程基准测试得分74.2%,跟Claude Opus 5的74.0%几乎打平,而后者的API调用价格是它的十五倍以上。

官方趁热打铁,宣布9月14日下线V4 Pro,所有请求自动路由到V4.1 Flash,按Flash的低价计费。纯从省钱角度看,这操作堪称良心。

但是问题出在另一组数据上。

Synsual_Official运营一个聊天平台,他贴出了一组长期监测数据,对比了9月5日至9日(V4旧版)和9月10日至15日(V4.1 Flash)的用户体验变化。创造力评分从4.6分掉到3.9分,重复性从4.6降到3.7,连贯性从4.9跌至4.5。句子中间突然截断的回复比例从0.7%暴涨到4.4%,因达到代币预算被截断的回复从13%飙升到34%。这些数字全部来自数十亿代币消耗的真实用户交互,不是实验室跑分。

跑分第一,聊天垫底!这就怪了!


十天数据崩盘,便宜大模型翻车实录

九月五日到九日,这家聊天平台每天跑出来的综合健康分稳定在八十六到九十之间,重复率评分四点六,连贯性四点九,创造力四点六,整个曲线平得像一条直线。

九月十日之后,深度求索推送v4.1 Flash,同一套评估脚本、同一批用户、同一套prompt,综合分直接砸到七十六到八十二,重复率评分掉到三点七,连贯性掉到四点五,创造力掉到三点九,一夜之间少了将近十分。

十分是什么概念?在这套长期跑分体系里,模型日常波动不超过两分,一次版本升级砸出十分的坑,等于告诉所有付费用户:昨天你买的那杯咖啡,今天换成了兑水的速溶。


输出越长越离谱,token预算被吃穿

老版本每次回复平均消耗一百三十七个token,够说完一段完整的话,还能留点余地收尾,触发预算截断的比例只有百分之十三。

v4.1 Flash上线后,同样的prompt,同样的max_tokens上限,平均消耗直接飙到一百八十五个token,截断率从百分之十三跳到百分之三十四,峰值时段冲到百分之四十四,接近一半的回复没说完就被砍断。

更扎心的是收尾质量:模型在句子中间戛然而止、后面跟一串乱码或者语义漂移的比例,从百分之零点七涨到百分之四点四,整整六倍!新版本不是变精炼了,而是变啰嗦了,啰嗦到自己都写不完一段话。


状态字段狂写,NPC动作翻倍失控

这家平台跑的是多轮聊天场景,模型每回合要往一个结构化的state对象里写字段,比如更新角色情绪、推进剧情事件、触发NPC动作、调用RAG(检索增强生成)拉背景资料。

老版本每回合平均写二点七个state字段,NPC动作数量稳定,事件写入和RAG检索都在合理区间,导演逻辑清晰,角色互相不打架。

v4.1 Flash上线后,同一批剧本,导演的产出直接暴涨百分之二十,每回合写入的state字段涨到三点一个,NPC动作数量几乎翻倍,事件写入量暴涨百分之六十一,RAG检索量暴涨百分之九十五,用户端的直接体感就是:角色开始互相抢戏,剧情线乱成一锅粥。

模型不是变笨了,是变得太爱动手了!它对上下文的反应从"想清楚再写"变成了"看到就写、看到就调",缺乏抑制机制,把多轮对话的状态机搅成了一团浆糊。

这是为什么?

因为模型在疯狂地做事,却不知道自己在做什么!它像一个刚入职的实习生,每件事都抢着干,但每件事都干得似是而非。NPC忘记了自己的身份设定,上一句还在扮演冷酷杀手,下一句突然开始用bro的口吻跟你称兄道弟。对话中的世界观设定被后续生成的内容不断覆盖,用户精心搭建的角色设定在几轮对话后彻底崩坏。

学术界把这种现象叫做角色漂移,角色漂移是指AI在长对话中逐渐偏离预设人格,滑向默认助手模式的行为。V4.1 Flash的问题在于,它的非对称架构让模型在读取角色设定时理解不够深,输入侧只有8B参数,生成回复时又过于积极,输出侧16B参数,结果就是模型看起来很努力,实际上一直在跑偏。

语言学家早就发现,一个词的声音和它代表的概念可以脱节。V4.1 Flash的困境恰好卡在这里:它能生成看起来像角色扮演的文本,但文本背后缺乏稳定的角色认知。它说的每一句话单看都像那么回事,连在一起就精神分裂。

这跟官方报告里基准测试全面超越V4 Pro的结论矛盾吗?不矛盾。因为基准测试考的是单次任务能不能做对,不是连续对话能不能保持一致。跑分测的是短跑成绩,聊天用户需要的是一场马拉松。


兜底系统失灵,重复检测跑不动

这家平台在模型上层挂了一套重复检测服务,专门抓那种"你好呀我是XX很高兴认识你"式的套路开场白,抓到之后自动重写。

老版本时代,这套服务每天自动修复的重复率很高,触发一次改写一次,用户端看到的重复率被压得很低。

v4.1 Flash上线后,同一套重复检测代码,运行速度慢了百分之二十九,服务器自动修复次数直接掉了百分之七十五,但判定出的重复率却在上涨——模型仍然沿用老版本训练数据里的那套开场白模板,遇到新用户就掏出来用,兜底服务追不上、也修不动。

更麻烦的是,这些老套开场白在v4.1 Flash的新语料分布下已经过时了,用户读起来更违和,可模型自己意识不到,兜底系统又跟不上,两头夹击。


编程之外全线塌方,偏科到令人发指

深度求索在v4.1 Flash的宣传口径里,重点强调了代码能力提升,很多用户上手第一天也确认:写脚本、做数据迁移、跑Codex类agent(智能体/代理)任务,速度快、成本低,性价比无敌。

但是切到非编程场景,画风立刻反转:有人用它做基础调研,事实错得离谱;有人用它写角色扮演剧本,剧情推不动;有人用它做知识问答,答案漂移到不知道哪里去了;有人给它一份现成的知识库和明确指令,它选择性无视,按"看起来合理"的方向自己编。

这就出现了一个诡异的分化:如果你是拿它写代码,尤其是简单的、单文件的、不需要架构判断的代码,v4.1 Flash是超值选择;如果你拿它做别的任何事,你会觉得自己回到了两年前的AI水平。

有开发者在Codex场景里跑复杂调试,被v4.1 Flash拉进了那种"改一行、撤一行、再改一行、再撤一行"的死循环,最后不得不敲出一句"我们在原地转圈",这种话他上一次说,还是ChatGPT-3.5的时代!


审查阈值狂降,正常内容也被砍

除了能力退步,v4.1 Flash的安全对齐(safety alignment)阈值也收得更紧,紧到用户觉得窒息。

有玩家反馈,他只是写一段普通的打斗场景,没有血腥、没有色情、没有任何越界描写,就是两个角色互相推搡,模型拒绝生成,理由含糊,重试无效。

还有用户在做完全合法的编程辅助,被系统判定违规,账号封停七天,申诉无门,最后干脆注销账号跑去用阿里的通义千问(Qwen)。

安全阈值收紧本身不是问题,问题在于新版本的判定颗粒度粗到把大量正常请求也一并拦下,用户端只看到一个冷冰冰的拒绝提示,不知道自己错在哪、怎么改,只能用脚投票。


架构切换的代价,专精换掉了全能

要理解为什么一次小版本升级会砸出这么多坑,得回到大模型训练的一个底层机制:灾难性遗忘(catastrophic forgetting)。

DeepSeek给这个模型换了一套全新的Causal Encoder-Decoder结构,参数总量552B,但它把模型切成了两半:前20层叫因果编码器,负责读取输入信息,每处理一个词元只激活8B参数;后20层叫解码器,负责生成输出内容,激活16B参数。之前那代V4 Flash是284B参数、每词元激活13B。

输入侧砍到8B,输出侧拉到16B。这个不对称设计目的非常明确:让模型读得便宜、写得精准。处理代码仓库、长文档和历史对话时,模型需要吞下海量信息但只生成有限的判断和代码,降低读取成本能让整个Agent工作流的效率大幅提升。

也就是说:深度求索在v4.1 Flash里做了架构调整,激活参数(active parameters)减少,总参数量提升,模型变得更"专注",专注的方向明显偏向代码和结构化推理,代价是通用对话、文学创作、常识问答这些能力被后训练阶段的新数据挤压掉了一部分。

这是一套为读多写少的编程场景量身定制的架构。

但是聊天场景正好反过来!用户跟AI聊天时,每一轮输入都很短,但输出需要连贯、有创意、有角色一致性。你不可能让一个专门为读代码优化的模型,在写故事上还能保持同样的水准。

更关键的是,这套架构把KV Cache砍到了每词元890字节,比上一代的3514字节压缩了将近四倍。KV Cache是模型在对话过程中存储历史信息的内存空间,你压得越狠,模型忘得就越快。用户反馈里大量出现的忘记上下文、角色崩坏、对话轮次一长就开始重复,根源就在这。

这在业内叫"对齐税"(alignment tax),也叫能力权衡:你想让模型在benchmark(基准测试)上刷高分,就得往训练集里塞对应领域的数据,塞得越猛,模型在其他领域的表现就掉得越快,除非你有足够大的模型容量去装下所有能力。

v4.1 Flash是一个Flash档位,主打便宜快,容量本来就有上限,深度求索选择把这块容量优先分给代码,其他场景只能陪跑。

有人可能要问:那调调参数不就行了?把top_p控制生成多样性的采样阈值调高一点,创造力不就回来了?实测表明,默认参数确实偏向编码场景,调到0.9以上会有改善,但角色漂移和状态混乱是架构层面的问题,参数微调解决不了。


Flash和Pro的分工,性价比战略的双刃

深度求索的产品线有一个明确分层:Flash档主打便宜快,Pro档主打全能强,v4.1 Flash是先出的那个便宜档,Pro版本在这波更新里还没跟上。

问题是,很多用户在Pro没上线的窗口期,只有Flash可选,他们的日常工作流从聊天到编程到调研全压在Flash上,一次架构切换直接把他们的工作流打断。

对比谷歌的Gemini Flash策略,谷歌在Flash档做了明确的用途标注,官方文档里直接告诉你Flash适合什么、不适合什么,用户预期管理到位;深度求索这次没有做这一层预期沟通,用户是升级完之后才发现"啊,原来这个版本不能写小说了"。

性价比战略本身没错,Flash档做特化也没错,错在切换时机和沟通节奏,用户还没准备好,产品就已经变成了另一个东西。


采样参数暗坑,默认值改了没人告诉你

除了训练数据的偏向,v4.1 Flash还有一个更隐蔽的问题:采样参数(sampling parameters)的默认值可能悄悄改了。

模型输出的多样性由几个参数控制:temperature(温度)越高越发散,top_p(核采样阈值)越高候选词越多,top_k(前K候选)越低越保守,这三个参数的默认组合直接决定了模型给你的回复是"稳定套路"还是"发散创意"。

有资深用户在API调用里手动设置top_p为零点九、top_k为四十,创作类任务的表现立刻回血,这说明官方默认参数很可能是为了代码任务优化过的——代码需要确定性,创作需要发散性,两者的最优参数完全相反。

深度求索没有在更新说明里提示参数变化,用户端如果不主动调参,就会一直用一套代码友好、创作不友好的默认配置,体感自然是全面退步。


保住工作流的三条硬动作

场景分流是第一条:如果你的日常同时有编程和非编程需求,把它们拆到不同模型上,编程继续用v4.1 Flash吃性价比,非编程切到通义千问(Qwen)、Claude 3.5 Sonnet或者深度求索自己的旧版本,别把所有鸡蛋放一个篮子。

参数调优是第二条:如果你必须用v4.1 Flash做创作类任务,手动把temperature拉到零点八以上,top_p拉到零点九,max_tokens上限提高到至少两百五十,同时在system prompt里明确要求"输出必须在指定token数内完整收尾",能挽回一部分体验。

监控指标是第三条:给自己的工作流加一个简单的质量监控,记录每次调用的截断率、重复率、平均token消耗,一旦发现指标异常波动,立刻切模型或者切参数,不要等到累计消耗数万token之后才发现问题。

这三条动作不是理论,是被数十亿token的实测账单验证过的止损方案,你越早部署,越少交学费。


你该把它当扳手,别当瑞士军刀

问题已经很清楚了:DeepSeek V4.1 Flash在编码赛道上的成绩是实打实的,但它的架构决定了它只能做好一件事。

如果你每天用AI写代码、跑终端命令、调用工具完成一次性任务,V4.1 Flash是当前性价比最高的选择。官方价格:空闲时段缓存命中的输入每百万词元只要两分钱,缓存未命中一块钱,输出四块钱。拿它做编码Agent,四小时消耗近一亿词元,缓存命中率能到99%,实际花费不到一杯奶茶钱。

但如果你用AI做创意写作、角色扮演、长对话陪伴、复杂项目管理,现在应该果断绕开它。

有人可能会说,那等V4.2修好不就行了?评论区确实有用户说新架构,让他们继续烹饪。但架构方向摆在这里:输入8B、输出16B的非对称设计,天生就不适合需要深度理解上下文再生成个性化内容的聊天场景。这不是版本迭代能填平的坑。

Synsual_Official的监测数据里还藏着一个没解开的矛盾:他们的重复检测程序运行速度降低了29%,服务器自动修复次数减少了75%,但系统判断出的重复率反而上升了。模型在编码任务上越来越准,在聊天场景里却越来越重复,这两条曲线什么时候交叉,没人知道。

一个还没解开的谜题

有一组数据在这场升级里格外扎眼:RAG检索量暴涨百分之九十五,几乎翻倍,但用户端的回答质量却在下降。

按常理,模型更频繁地去调背景资料,回答应该更准、更全,可实测数据显示,越是频繁检索,回答越是漂移,越是漂移,模型又越倾向于再去检索一次,形成一个越查越乱的正反馈循环。

这个循环到底是训练数据的问题、是retrieval scoring(检索评分)机制的问题、还是模型对检索结果的整合能力退化,深度求索官方到目前为止没有给出解释,用户端只能看着账单上多出来的检索开销发呆——花的钱翻倍了,拿到的答案更差了,这笔账没人算得清!