|
8月12日深夜,DeepSeek官网API文档悄悄换了版本。 模型从“V4-Pro预览版”变成了“DeepSeek-V4-Pro-0813”。最先发现变化的永远是熬夜写代码的开发者们。随后一张评测对比表从官方群流出,AI圈的深夜被彻底点亮。 Terminal Bench 2.1,87.9分。全球第一的Anthropic Fable 5是88.0分。差距只剩0.1分。 三个月前的预览版,这个数字是72.1分。一次跃升15.8分。 这不是唯一的好消息。AI安全智能体基准Cybergym上,V4 Pro拿到83.3分,压过了Fable 5的83.1。工作流智能体AutomationBench中,31.8分对29.1分,同样胜出。 最夸张的是软件工程测试DeepSWE。预览版12.8分,正式版直接跳到62.7分。接近原来的五倍。这个成绩超过了Anthropic上一代旗舰Opus 4.8的58.0分。 智能体,是理解这次升级的唯一关键词 传统大模型比拼的是知识问答和数学推理。但Terminal Bench、DeepSWE这类测试,考察的是AI能不能真正干活——调用工具、执行多步骤任务、编写和修改代码、在长链条里持续推进直到交付结果。这是大模型从聊天玩具走向生产工具的核心门槛。 DeepSeek官方API文档显示,V4 Pro正式版支持1M Token上下文长度,最大输出384K Token,同时兼容OpenAI和Anthropic两种API格式。开发者几乎不用改代码,就能把原本调用Claude的应用切换到DeepSeek上。 这次更新的时间点很有意思。就在V4 Pro上线前几个小时,马斯克旗下SpaceXAI发布了Grok 4.6。在GDPVal-AA v2评估中以1753 Elo登顶,超过Fable 5的1741和GPT-5.6 Sol Max的1728。两款主打高性价比的模型同夜撞车。梁文锋和马斯克,不约而同把矛头指向同一件事:让AI在长任务里稳定交付可用成果。 真正感到压力的,恐怕是OpenAI和Anthropic。 目前Fable 5每百万输出Token定价50美元,GPT-5.6 Sol Max是30美元,Grok 4.6是6美元。而DeepSeek V4 Pro是多少?输入3元/百万Token、输出6元/百万Token。按实时汇率换算,大约0.87美元。约为Fable 5的五十七分之一。 0.1分的跑分差距背后,是五十七倍的价格鸿沟。这个等式,足以让每个开发者重新审视自己的技术选型。 一张涨价预告函的底气 V4 Pro的性能表现,也在一定程度上解释了六天前那则震动行业的公告。 8月6日,DeepSeek在开发者后台发布通知:“计划近期整体上调DeepSeek API服务的定价,预计涨幅较大”。这是DeepSeek首次预告整体上调API价格,而非此前针对高峰时段的局部调整。 市场之所以震动,因为DeepSeek过去一年的形象恰恰是“价格屠夫”。 梳理定价时间线:4月V4发布时,V4 Pro API以2.5折优惠上线;5月31日优惠结束后直接永久降至原价的四分之一;6月29日引入峰谷计费,工作日高峰时段价格翻倍。从永久降价到预告大涨,中间只隔了两个多月。 DeepSeek当然有自己的难处。OpenRouter数据显示,7月27日至8月2日当周,DeepSeek V4 Flash以7.22万亿Token的调用量位居全球第一。另据开源项目OpenCode统计,仅8月1日一天,V4 Flash处理量就达到8万亿Token。8月4日,模型甚至因访问量过大出现容量不足。 调用量是蜜糖,也是负担。每一次API调用背后都是真金白银的算力消耗。长时间低价跑量,持续吞噬的是现金流。 但如果只把涨价理解为“扛不住成本”,可能低估了DeepSeek的意图。 一个容易被忽略的细节:仅仅两个月前的6月16日,DeepSeek完成首轮外部融资,募资超500亿元人民币,投后估值突破3500亿元。创始人梁文锋个人出资约200亿元。最新消息显示,DeepSeek已在推动第二轮保底100亿元的融资。 手握重金却选择涨价。这更像一次主动的定价策略切换,而非被动的成本转嫁。 摩根士丹利8月9日发布的研报给出了三个驱动因素:V4模型需求旺盛,支撑了更强定价能力;厂商需在市场份额与毛利率间寻求平衡,以持续投入前沿研发;更多使用国产芯片可能带来更高推理成本。 报告认为,模型智能,而非价格,才是大模型竞争的终极壁垒。当V4 Pro在Terminal Bench上距Fable 5仅差0.1分时,DeepSeek已经有资格为这份“足够接近”收取溢价。 价格战的终局信号 DeepSeek的涨价不是孤例。 据摩根士丹利统计,以字节跳动、阿里、百度、腾讯、智谱、月之暗面及DeepSeek为样本,中国大模型平均API输出价格已从2025年一季度的约12.2元/百万Token,回升至2026年二季度的21.9元/百万Token。 拐点早已出现。 今年一季度,智谱API定价较去年底累计上调约83%,但调用量反而增长了400%。量价齐升,说明开发者愿意为更强的模型付费。 7月,月之暗面发布Kimi K3后48小时内请求量超出预估,逼近集群承载极限,直接暂停C端新用户订阅。K3输出价格涨到100元/百万Token,较上一代涨超3.5倍。 腾讯在3月至4月间两轮上调模型API价格,部分涨幅高达463%。MiniMax、阿里云等也相继收紧免费额度、调整计费方式。 过去两年国内大模型赛道深陷Token价格厮杀。但进入2026年下半年,算力供需、芯片采购成本、运营成本持续走高。单纯靠低价换规模的模式难以为继。 逻辑其实不复杂。Agent任务的算力消耗是普通对话的十到一百倍。当模型开始真正进入企业的生产流程——写代码、做分析、跑流程——客户对价格的敏感度会让位于对可靠性和能力的要求。智谱涨了83%依然供不应求,已经说明了问题。 摩根士丹利将其概括为一个飞轮:更强的模型带来更多收入,更多收入支撑更大投入,更大投入再次推高模型能力。头部厂商可以随时推出低价轻量版本覆盖大众市场,但中等厂商想要向上突破至顶尖水平,难度完全不在一个量级。 这或许才是DeepSeek深夜换版的真正注脚。它先用V4 Pro证明自己“能干活”,拿到了与全球顶尖模型同台竞技的入场券。再用一纸涨价预告,测试市场对“中国智能”的支付意愿。 当然,考题也随之而来。涨价之后,那些对成本极度敏感的中小开发者是否会迁移?“涨幅较大”究竟是多大?在Grok 4.6等同梯队选手仍以低价猛攻的背景下,DeepSeek的定价权能维持多久? 这些问题,要在涨价正式落地后才能回答。但有一点可以确定:当最擅长打价格战的玩家开始收枪,中国大模型行业的竞争逻辑,已经翻过了一页。
版权声明
“特别声明:以上作品内容(包括在内的视频、图片或音频)为用户上传并发布,本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user , the platform merely provides information storage space services.”
本文地址: https://www.amtbbs.org/thread-18428-1-1.html
|