解语樱木 发表于 5 天前

字节跳动为什么坚决不“蒸馏”别人的模型?

2026年8月,AI圈被一条消息刷了屏——字节跳动创始人张一鸣在Seed团队全员会上明确表态:字节跳动不会把模型蒸馏当作提升AI能力的捷径,即便这意味着公司眼下落后于国内竞争对手。消息来自《The Information》的独家报道。张一鸣的原话是:“为了实现长远目标,我们应该愿意牺牲一些短期利益”。他还说,做模型要坚持长期主义、延迟满足感,不能用别人的输出换一时的榜单排名。这个消息之所以引发广泛关注,是因为它揭开了字节AI团队内部一场持续了一年多的路线之争。什么是模型蒸馏?为什么大家都在做?先简单解释一下“蒸馏”是什么。模型蒸馏是一种训练技术:让一个“学生模型”学习“教师模型”产生的答案、推理轨迹或工具调用过程,以更低成本复现教师模型的部分能力。说得直白点,就是让一个更强的模型(通常是别人家的)给自己“喂答案”,自己照着学。几乎所有头部AI实验室都会做自蒸馏——用自己的模型生成数据,再喂回自己的训练体系。但争议的焦点是跨模型蒸馏——直接拿竞争对手的SOTA(当前最优)模型的输出来训练自己。这样做的好处很明显:省钱、省时间、见效快。一个新模型可以在几个月内补齐推理、编程和Agent能力,迅速缩小和头部模型的差距。但字节跳动的选择是:不做。三次动摇,三次被否据内部员工透露,Seed团队关于“要不要蒸馏”的争论已经持续了很久。每当国内发布一个新的强大开源模型,这个争论就会升温。第一次争论:DeepSeek-R1发布后2025年1月,DeepSeek-R1以极低的训练成本展现出强大的推理能力,震动了整个硅谷。Seed内部一些研究员感到焦虑——字节的人才密度、算力投入都不弱,但模型表现却没有达到R1的水平。当时业内就有猜测,DeepSeek可能在训练过程中使用了美国前沿模型的生成数据。虽然这个说法从未被证实,但在Seed内部,它成了一个现实的提问:同行都能这么干,我们为什么不能?一些研究员建议:引入美国头部闭源模型的生成结果,快速提高Seed语言模型的能力。不需要放弃自己的预训练,只是“补一剂药”。这个提议被否决了。第二次争论:Blackwell芯片大规模部署后2025年底,英伟达Blackwell系列GPU大规模进入美国头部实验室。由于美国的出口管制,中国实验室拿不到性能最先进的“B卡”。一个不为人知的细节是:字节的视频模型Seedance 2.0——公认的全球SOTA视频生成模型——是在大量H20芯片上训练出来的。H20是专供中国市场的“阉割版”,综合性能只有B200的五十分之一。算力差距被骤然拉大。美国顶级模型——从GPT-5.5到Claude 4.8——在推理、编程和科学领域出现了智能跃迁,背后都是Blackwell的功劳。Seed内部再次有人提出:既然算力追不上,那就用数据换回来。把稀缺的训练资源集中到已经被证明有效的方向上。这个提议又被否决了。第三次争论:Kimi K3问世后2026年7月,月之暗面发布了Kimi K3。这款2.8万亿参数的开源模型,在Frontend Code Arena编程榜上以1679分超越Claude Fable 5,排名全球第一。一家规模和算力远小于字节的实验室,把开源模型做到了全球第一阵营。而投入更大、人才更多的Seed,始终没有拿出一款位置相当的语言模型。这一次,蒸馏的提议被更大声地提了出来,得到了更多人的响应。内部甚至出现了一个折中方案:既然蒸馏美国闭源模型风险太高,那至少可以蒸馏表现最好的开放权重模型——授权更宽松,法律和商业风险低得多。他们等到了张一鸣的直接表态。张一鸣说:闭源模型不能蒸馏,开放权重模型也不能蒸馏。Seed可以接受暂时的落后,但不接受依靠蒸馏竞争对手来消除这种落后。据知情人士透露,这次Seed全员会就是为了统一认识——传递一个清晰的技术判断:关键不是短期的输赢,而是真正影响长期的基础工作和基础研究,有没有被真正重视、认真做好。会后,Seed内部出台了新政策:明确禁止蒸馏K3等开放权重模型,并通过API检测等手段追溯排查疑似蒸馏行为。为什么坚决不做?很多人第一反应是:怕TikTok出事。《The Information》的报道也确实提到了这个角度——字节跳动和美国政府之间复杂的历史,让它在AI蒸馏问题上格外谨慎。但据内部人士透露,TikTok的前景在张一鸣的决策中权重几乎为零。他关心的核心问题只有一个:Seed能不能追求到最前沿的智能。更深层的原因是:蒸馏会干扰真正意义上的长期技术突破。怎么理解这句话?蒸馏确实能让一个模型快速“抄近道”进入前沿。但它无法告诉实验室——这些能力到底是怎么产生的;更无法保证——当现在SOTA模型的智能边界走到尽头时,蒸馏的一方下一步该往哪走。换句话说:一款模型可以通过蒸馏进入前沿,一家实验室却不能通过蒸馏成为前沿实验室。字节的选择是:宁可落后,也不走捷径。这意味着要为独立探索支付更多算力、时间和失败成本。字节的“异类”处境这个选择让字节在国内AI圈成了一个“异类”。字节跳动是国内主要AI公司中唯一一家大语言模型几乎全为专有模型的企业。同行们几乎都在做开源,字节坚持闭源。字节的旗舰语言模型并不总出现在全球主流排行榜上。在Arena AI的Web开发编码排行榜上,Seed 2.1 Pro排名第19位,远低于其他中国模型。但另一方面,字节的视频生成模型Seedance 2.0是全球公认的SOTA。这证明了一件事:字节不是做不出好模型,只是选择把资源优先投入到了视频赛道。语言模型落后,是战略选择的结果,不是能力问题。一个更大的背景:蒸馏正在成为地缘政治问题字节的“拒绝蒸馏”决策,发生在中美AI竞争日益激烈的背景下。过去半年,美国AI公司Anthropic已经多次公开指控中国实验室对其Claude模型进行“蒸馏攻击”。2026年6月,Anthropic甚至指控阿里巴巴通过上万虚假账号,与Claude进行了超过2880万次交互。模型蒸馏正在从一个技术问题,变成一个地缘政治问题。但字节跳动的拒绝蒸馏原则,发端于这些外部压力之前。早在2023年,字节内部就已明确要求不得将GPT生成的数据加入训练数据集。当时蒸馏远不是今天这样的“敏感词”。这条路能走通吗?没有人知道答案。张一鸣自己也没有承诺这条路一定能成功。但他明确了一件事:字节愿意为长期目标牺牲短期利益。这个“长期目标”是什么?他并没有详细说明。但可以确定的是——追求模型的真正智能,优先级远高于TikTok的命运,也远高于短期的榜单排名。这条路意味着Seed可能在某些时候落后,也意味着它要为独立探索支付更多成本。但至少在目前,这些都是被接受的。字节跳动的选择,正在把“蒸馏”从一个技术选项,变成一个战略分水岭。
页: [1]
查看完整版本: 字节跳动为什么坚决不“蒸馏”别人的模型?