AMT|智造云|世界先进制造技术论坛,领先的高科技先进制造产业服务平台

发表于 2026-8-7 14:37:10 | 显示全部楼层 |阅读模式
2026年8月,AI圈被一条消息刷了屏——字节跳动创始人张一鸣在Seed团队全员会上明确表态:字节跳动不会把模型蒸馏当作提升AI能力的捷径,即便这意味着公司眼下落后于国内竞争对手。
消息来自《The Information》的独家报道。张一鸣的原话是:“为了实现长远目标,我们应该愿意牺牲一些短期利益”。他还说,做模型要坚持长期主义、延迟满足感,不能用别人的输出换一时的榜单排名。
这个消息之所以引发广泛关注,是因为它揭开了字节AI团队内部一场持续了一年多的路线之争。
什么是模型蒸馏?为什么大家都在做?
先简单解释一下“蒸馏”是什么。
模型蒸馏是一种训练技术:让一个“学生模型”学习“教师模型”产生的答案、推理轨迹或工具调用过程,以更低成本复现教师模型的部分能力。说得直白点,就是让一个更强的模型(通常是别人家的)给自己“喂答案”,自己照着学。
几乎所有头部AI实验室都会做自蒸馏——用自己的模型生成数据,再喂回自己的训练体系。但争议的焦点是跨模型蒸馏——直接拿竞争对手的SOTA(当前最优)模型的输出来训练自己。
image.png
这样做的好处很明显:省钱、省时间、见效快。一个新模型可以在几个月内补齐推理、编程和Agent能力,迅速缩小和头部模型的差距。
但字节跳动的选择是:不做。
三次动摇,三次被否
据内部员工透露,Seed团队关于“要不要蒸馏”的争论已经持续了很久。每当国内发布一个新的强大开源模型,这个争论就会升温。
第一次争论:DeepSeek-R1发布后
2025年1月,DeepSeek-R1以极低的训练成本展现出强大的推理能力,震动了整个硅谷。Seed内部一些研究员感到焦虑——字节的人才密度、算力投入都不弱,但模型表现却没有达到R1的水平。
当时业内就有猜测,DeepSeek可能在训练过程中使用了美国前沿模型的生成数据。虽然这个说法从未被证实,但在Seed内部,它成了一个现实的提问:同行都能这么干,我们为什么不能?
一些研究员建议:引入美国头部闭源模型的生成结果,快速提高Seed语言模型的能力。不需要放弃自己的预训练,只是“补一剂药”。
这个提议被否决了。
第二次争论:Blackwell芯片大规模部署后
2025年底,英伟达Blackwell系列GPU大规模进入美国头部实验室。由于美国的出口管制,中国实验室拿不到性能最先进的“B卡”。
image.png
一个不为人知的细节是:字节的视频模型Seedance 2.0——公认的全球SOTA视频生成模型——是在大量H20芯片上训练出来的。H20是专供中国市场的“阉割版”,综合性能只有B200的五十分之一。
算力差距被骤然拉大。美国顶级模型——从GPT-5.5到Claude 4.8——在推理、编程和科学领域出现了智能跃迁,背后都是Blackwell的功劳。
Seed内部再次有人提出:既然算力追不上,那就用数据换回来。把稀缺的训练资源集中到已经被证明有效的方向上。
这个提议又被否决了。
第三次争论:Kimi K3问世后
2026年7月,月之暗面发布了Kimi K3。这款2.8万亿参数的开源模型,在Frontend Code Arena编程榜上以1679分超越Claude Fable 5,排名全球第一。
image.png
一家规模和算力远小于字节的实验室,把开源模型做到了全球第一阵营。而投入更大、人才更多的Seed,始终没有拿出一款位置相当的语言模型。
这一次,蒸馏的提议被更大声地提了出来,得到了更多人的响应。内部甚至出现了一个折中方案:既然蒸馏美国闭源模型风险太高,那至少可以蒸馏表现最好的开放权重模型——授权更宽松,法律和商业风险低得多。
他们等到了张一鸣的直接表态。
张一鸣说:闭源模型不能蒸馏,开放权重模型也不能蒸馏。Seed可以接受暂时的落后,但不接受依靠蒸馏竞争对手来消除这种落后。
据知情人士透露,这次Seed全员会就是为了统一认识——传递一个清晰的技术判断:关键不是短期的输赢,而是真正影响长期的基础工作和基础研究,有没有被真正重视、认真做好。
会后,Seed内部出台了新政策:明确禁止蒸馏K3等开放权重模型,并通过API检测等手段追溯排查疑似蒸馏行为。
为什么坚决不做?
很多人第一反应是:怕TikTok出事。
《The Information》的报道也确实提到了这个角度——字节跳动和美国政府之间复杂的历史,让它在AI蒸馏问题上格外谨慎。
但据内部人士透露,TikTok的前景在张一鸣的决策中权重几乎为零。他关心的核心问题只有一个:Seed能不能追求到最前沿的智能。
更深层的原因是:蒸馏会干扰真正意义上的长期技术突破。
怎么理解这句话?
蒸馏确实能让一个模型快速“抄近道”进入前沿。但它无法告诉实验室——这些能力到底是怎么产生的;更无法保证——当现在SOTA模型的智能边界走到尽头时,蒸馏的一方下一步该往哪走。
换句话说:一款模型可以通过蒸馏进入前沿,一家实验室却不能通过蒸馏成为前沿实验室。
字节的选择是:宁可落后,也不走捷径。这意味着要为独立探索支付更多算力、时间和失败成本。
字节的“异类”处境
这个选择让字节在国内AI圈成了一个“异类”。
字节跳动是国内主要AI公司中唯一一家大语言模型几乎全为专有模型的企业。同行们几乎都在做开源,字节坚持闭源。
字节的旗舰语言模型并不总出现在全球主流排行榜上。在Arena AI的Web开发编码排行榜上,Seed 2.1 Pro排名第19位,远低于其他中国模型。
但另一方面,字节的视频生成模型Seedance 2.0是全球公认的SOTA。这证明了一件事:字节不是做不出好模型,只是选择把资源优先投入到了视频赛道。
语言模型落后,是战略选择的结果,不是能力问题。
一个更大的背景:蒸馏正在成为地缘政治问题 image.png
字节的“拒绝蒸馏”决策,发生在中美AI竞争日益激烈的背景下。
过去半年,美国AI公司Anthropic已经多次公开指控中国实验室对其Claude模型进行“蒸馏攻击”。2026年6月,Anthropic甚至指控阿里巴巴通过上万虚假账号,与Claude进行了超过2880万次交互。
模型蒸馏正在从一个技术问题,变成一个地缘政治问题。
但字节跳动的拒绝蒸馏原则,发端于这些外部压力之前。早在2023年,字节内部就已明确要求不得将GPT生成的数据加入训练数据集。当时蒸馏远不是今天这样的“敏感词”。
这条路能走通吗?
没有人知道答案。
张一鸣自己也没有承诺这条路一定能成功。但他明确了一件事:字节愿意为长期目标牺牲短期利益。
这个“长期目标”是什么?他并没有详细说明。但可以确定的是——追求模型的真正智能,优先级远高于TikTok的命运,也远高于短期的榜单排名。
这条路意味着Seed可能在某些时候落后,也意味着它要为独立探索支付更多成本。但至少在目前,这些都是被接受的。
字节跳动的选择,正在把“蒸馏”从一个技术选项,变成一个战略分水岭。

回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册 |

本版积分规则

主题 73 | 回复: 74

QQ|联系我们|法律声明|用户协议|AMT咨询|商务合作|会员入驻|积分充值|积分商城|积分奖励规则|TradEx全球购|加入QQ技术群|添加企业微信|加入微信技术群|智造号|手机版| 世界先进制造技术论坛™(简称AMT™, 智造云™) ( 沪ICP备12020441号-3 ) |Sitemap

GMT+8, 2026-9-15 07:28 , Processed in 0.111996 second(s), 49 queries .

论坛声明:AMT-智造云(世界先进制造技术论坛) 属纯技术性论坛,我们严格遵守《中华人民共和国网络安全法》、《个人信息保护法》等国家相关法律法规,请勿发布非法言论、非法广告等信息,多谢合作。
本论坛言论纯属发表者个人意见且会员单独承担发表内容的法律责任,与本论坛立场无关;会员参与本论坛讨论必须遵守中华人民共和国法律法规,凡涉及政治言论、色情、毒品、违法枪支销售等信息一律删除,并将积极配合和协助有关执法机关的调查,请所有会员注意!
本论坛资源由会员在本论坛发布,版权属于原作者;论坛所有资源为会员个人学习使用,请勿涉及商业用途并请在下载后24小时删除;如有侵犯原作者的版权和知识产权,请来信告知,我们将立即做出处理和回复,谢谢合作!

合作联系: 双日QQ客服:3419347041    单日QQ客服:3500763653    电话021-37709287    合作问题投诉:QQ:2969954637    邮箱:info@amtbbs.org    微信公众号:AMTBBS

 

快速回复 返回顶部 返回列表