YC掌门人紧急发声:美国开源AI必须“蒸馏”前沿模型破局

YC 掌门人大胆发声:美国 AI 初创,大可 “蒸馏” 自家巨头模型

靠孵化投资创业公司立足的 YC 掌门人 Garry Tan,最近的一番表态,把 AI 蒸馏的双重标准摆到台面上。

Garry Tan,硅谷最出名的创业加速器Y Combinator的CEO,前几天接受CNBC采访时说了句让整个AI圈炸锅的话:面对中国AI实验室蒸馏美国前沿模型这件事,他的态度是“什么也不做”;更狠的是,他补了一句——我们甚至可以搞一个“美国蒸馏制度”!

这一观点迅速引爆 AI 圈!抛开立场对错,现实的拷问摆在眼前:同样一套蒸馏技术,美国大厂使用属于研发创新,中国企业使用就被指责偷窃,那美国小公司开展同类操作,又该如何定性?


蒸馏是正经技术,却被说成“非法”

模型蒸馏(Model Distillation)是辛顿在2015年跟学生一起提出的技术,核心动作是让一个大模型当老师,把输出概率分布教给一个小模型;老师给出的不是简单对错,而是“猫80%、狗15%、狐狸5%”这种暗知识,学生模型从这些概率里学会判断边界。

这个技术公开、合法、标准,OpenAI在官方文档里教开发者用蒸馏训练小模型,Meta的Llama系列、阿里的Qwen系列、DeepSeek的R1都大量使用蒸馏;蒸馏本身就像厨师学徒尝一万盘菜,学的是火候和判断力,不是复制师傅的手。

但是,同一个技术动作换个人做就换了性质!美国公司蒸馏美国公司叫技术交流,中国公司蒸馏美国公司,Anthropic的CEO达里奥·阿莫代伊管这叫“非法蒸馏攻击”;Anthropic在2026年9月发布第二份威胁情报报告,点名指控七家中国AI实验室对Claude模型进行非法蒸馏,被点名的包括阿里巴巴、月之暗面、DeepSeek和小米。

Anthropic报告里最有冲击力的数字是:2026年5月到7月之间,观察到超过1.51亿次与阿里巴巴相关的交互,每日高峰接近300万次,涉及超过3500个被指为虚假的账户;这个规模确实惊人,每天300万次查询相当于每秒差不多35次,正常用户不可能这么用。

但是,先别被数字吓住!Anthropic说的是“与阿里巴巴相关”,它给出的依据是“被指为虚假的账户”,这些账户到底是谁注册的、谁在操作的,报告里没有展示法庭级别的证据链;它只是在说“我们认为这些活动跟阿里巴巴有关”,这就怪了。

大公司吸数据,为何只抓小公司

Garry Tan在采访里说了一句让Anthropic CEO不太爱听的话:那些闭源AI实验室自己训练模型的时候,也没问过版权持有者的许可;它们吞下了海量的受版权保护的内容来训练自己的模型。

Anthropic自己就因为版权问题栽过跟头,TechCrunch报道提到,Anthropic已经在一个涉及15亿美元的版权集体诉讼中达成了和解,这是AI行业迄今为止最大的版权和解案;换句话说,这些大公司过去几年干的事情,本质上也是“未经许可使用别人的东西来训练自己的模型”,只不过它们用的素材是书、文章、图片,而中国公司用的素材是它们的API输出。

用版权内容训练模型叫“合理使用”,用API输出训练模型叫“非法蒸馏”!这套逻辑的荒谬之处在于:你的学习材料是从别人那里“拿”的,但别人从你这里“学”就不行了;这就像一个小偷跑去报警说别人偷了他的赃物,盗窃的链条上到底谁比谁干净,这事儿真经不起细想。最多是黑吃黑。

Garry Tan的观点特别锋利,他在TechCrunch的采访里说:控制用户和客户怎么使用闭源模型的API输出,这种感觉本身就很压抑;政府在这里可以发挥一个作用,把“用广泛公开数据训练出来的智能”正常化,让它更像是一种公共品,而不是被锁在限制性服务条款后面的东西。

白宫备忘录来了,法律却管不住

Anthropic的CEO达里奥·阿莫代伊之前就公开呼吁美国监管机构打击蒸馏;Anthropic在2026年9月发布第二份报告,指控中国实验室隐藏身份、依靠欺诈和窃取凭证来蒸馏,这套叙事把蒸馏从合同问题推向了国家安全问题。

法律圈的人看这场蒸馏争议,看到的其实是另一回事;斯坦福大学法学院的附属研究机构、加州大学法学院科技期刊上都有论文在讨论这个问题,核心结论出奇一致:按照现行美国法律,蒸馏几乎不可能构成版权侵权。

为什么呢?两个原因;第一,AI生成的输出内容本身不受版权保护,美国版权局一贯的立场是版权必须有人类作者,AI生成的文本、代码、图片都不符合“人类作者”标准;第二,蒸馏过程中复制的是模型的行为模式,不是模型的代码或权重,这就好比你学会了我的说话风格,但你并没有复制我的声带,版权法管不了这个。

那美国大公司靠什么保护自己?靠服务条款,也就是用户协议;OpenAI的条款明确禁止用户“利用输出开发与OpenAI竞争的产品”,Anthropic的条款更狠,禁止“开发或训练任何人工智能或机器学习算法或模型”;违反这些条款的后果是什么?账号被封,就这么简单。

一家律所的分析文章指出,违反服务条款的法律救济手段非常有限,主要就是终止账户;想靠合同法去追偿损失?你得证明对方造成了实际损失,这个举证难度极高,所以现在的情况是:版权法管不了;合同法只能封账号;反垄断法针对的是市场支配地位而不是模型蒸馏本身。

法律上根本拦不住的事情,美国大公司选择了另一条路——把它包装成国家安全问题;一旦上升到国家安全层面,就可以动用出口管制、外国投资审查、情报共享这些行政工具,绕过立法程序直接打击竞争对手;这就是从“你违约了”到“你威胁我们国家安全”的语义跳跃,跳得不可谓不大!

开源模型崛起,巨头开始抢规则

Garry Tan在CNBC的采访里说:“他们处在前沿,在推动进步;我们希望这件事能持续获得投资、能是一个好的商业模式;你也希望开源模型给人们自由和访问权”;他没有说要消灭闭源模型,他说的是平衡。

这场蒸馏争议的叙事框架看起来是“美国 vs 中国”,但如果你把视角拉近一点,会看到一个更真实的画面:闭源大公司在用监管壁垒挤压开源小公司的生存空间;Garry Tan的原话是:“对AI来说,最噩梦的场景、最末日论者的场景,就是只剩一家公司,它拥有最好的资本渠道、最好的AI研究员,它一路绝尘而去,突然之间就只有这一家巨型垄断公司了;那就太糟糕了”。

Garry Tan不是在做慈善,他是在做投资判断;Y Combinator投了上百家AI初创公司,这些公司大多数用不起GPT-4或者Claude的昂贵API,它们能活下去的办法之一就是用开源模型;如果美国只有闭源模型,这些初创公司要么付不起API费用,要么被大公司的条款绑死,要么干脆做不出产品。

Garry Tan说的“美国蒸馏制度”,潜台词是:美国的小公司应该能合法地从美国大公司的模型里提取知识来训练自己的开源模型,这样美国才能有一批拿得出手的开源模型来跟中国的DeepSeek、Qwen、Kimi竞争;中国开源模型现在确实很强,根据OpenRouter的数据,中国模型已经占到了美国企业在该平台上token用量的超过一半。

垄断才是噩梦,平衡没有落脚点

Garry Tan在CNBC的采访里说:“我们想看到开源权重AI实验室和前沿实验室之间的平衡;他们处在前沿,在推动进步;我们希望这件事能持续获得投资、能是一个好的商业模式;你也希望开源模型给人们自由和访问权”;这段话说得很清楚,他不想消灭闭源模型,他怕的是一家公司垄断所有智能。

这个平衡,目前在所有现行法律框架下都找不到落脚点;版权法管不了模型蒸馏;合同法只能封账号;反垄断法针对的是市场支配地位而不是模型蒸馏本身;法律工具箱里最趁手的工具反而是“国家安全”这张万能牌,而这恰恰是最模糊、最容易被滥用的一张牌。

一个值得追踪的观察点是:Anthropic报告里声称的“3500个虚假账户”和“1.51亿次交互”,到底有多少能被独立验证?如果这些数字经不起推敲,那整套“国家安全蒸馏”的叙事就会像沙滩上画的防线,潮水一冲就没了;如果这些数字是真的,那真正该追问的是另一个问题:为什么一个账号每天查询几千次不会被自动封禁,非要等三个月之后才发一份报告出来。

监管如果要来,它最好带着可验证的证据来,而不是带着一份谁也没法核实的威胁情报报告;这事还没完,因为蒸馏技术本身不会消失,开源模型也不会消失,真正会消失的,可能是那些既想用公共数据训练模型、又想用服务条款锁死所有后来者的双标玩法。


网友总体站队:大多数人支持Garry Tan

Hacker News上268个点赞、136条评论,讨论热度相当高,整体舆论明显偏向Garry Tan一边;最核心的情绪是:前沿AI实验室自己没有道德高地来指责别人蒸馏,因为他们训练模型时也是未经许可地“扫荡”了整个人类知识库。

网友kelnos的评论获得了最高共鸣:前沿模型建立在大量受版权保护的作品之上,有些素材甚至是通过非法手段获得的;这些实验室对最终结果没有道德或伦理上的所有权,其他人应该自由地把任何公司施加的使用限制视为无效;他还直接开火——“非法蒸馏攻击”这个说法完全站不住脚,既不存在“非法”,也不存在“攻击”,大公司只是不喜欢这件事威胁到了它们的市场地位和商业模式。

这个立场得到了大量附和;网友stymaar打了个比方:如果蒸馏算“攻击”,那我是不是可以说Anthropic训练时用了我的互联网写作,所以它对我发动了“训练攻击”;overfeed补了一刀:Anthropic自己对开源仓库和整个互联网实施了无数次“版权攻击”。

YC老板的动机被扒了个底朝天

也有网友并不买账这套情怀叙事,直指 Garry Tan 背后的利益考量。toomuchtodo 直言:YC 的商业模式就是扶持初创公司直至变现;若企业都要向 OpenAI、Anthropic 采购 API,烧钱速度会大幅加快,Garry Tan 只是在为自己的投资组合发声,仅此而已。

SOLAR_FIELDS 进一步提出思辨:当人出于私利做了正确的事,究竟该否定这件事,还是视作激励机制达成对齐?dofm 将其概括为 “开明的自利”。

zetazzed 对 Anthropic 商业模式提出拷问:版权和解中他们平均每部作品赔付约 3000 美元,加上每年数十亿美元的标注与数据成本。倘若这些投入能被开源模型轻易复刻,企业何必持续投入?想要 AI 在各细分领域持续迭代,这套经济模式难以为继。

kadoban 反驳:违法产生的罚金不能算作正常经营成本,这无异于自认问题;该观点本质是主张要容许违规主体继续运营,还要帮其商业模式自圆其说。

wonnage 补充:把所有书籍数据喂进模型,从中攫取的价值必然远超 15 亿美元;如果达不到,这项生意本身就站不住脚。


数据隐私成了另一个战场

讨论很快从 “蒸馏是否合法” 转向 API 调用时的用户数据处理问题。torginus 提出担忧:Navier-Stokes 争议之后,有理由怀疑,所有送入模型的知识产权内容最终都可能归平台所有。OpenAI 也承认过类似的轻度风险 —— 提示词可能意外混入训练数据,只是影响范围未知。

zdragnar 补充细节:不少平台号称零数据留存,但条款暗藏陷阱。个人 Pro 版虽可关闭 “使用数据训练模型” 开关,却仍允许平台出于统计、“研究” 目的评估匿名化用户数据;只有企业合同,才能明确各项设置对应的留存规则。

ssivark 介绍另一类服务商:Baseten、Modal、Fireworks、Together 等推理平台,主打开源权重模型,并用明确条款承诺不使用用户数据。曾在 Baseten 短期任职的 hazard 证实,平台不会留存这些数据,不过这也带来工程上的麻烦:客户反馈模型故障时,团队无法查看输入输出。

steveBK123 则代表对立观点:既然厂商曾经用盗版数据训练模型,很难让人相信它们会遵守零留存承诺。applfanboysbgon 说得更直接:零数据留存、训练退出选项都只是口头承诺;只要无法掌控推理硬件,就掌控不了自己的数据。