AMT|智造云|世界先进制造技术论坛,领先的高科技先进制造产业服务平台

发表于 2026-7-31 14:29:40 | 显示全部楼层 |阅读模式
马斯克又出手了。
7月30日,他旗下SpaceXAI正式推出新一代语音模型Grok Voice Think Fast 2.0。马斯克本人连发两条推文,第一条宣布“Grok Voice现在在智能体性能方面排名第一”,第二条直接喊话网友“试试新的Grok Voice”。
image.png
评论区一下就热闹了。有网友说想拿它生成多角色有声剧,还有开发者直言之前一直用Gemini,终于有了新选择。
image.png image.png
这款模型到底强在哪?一句话总结:能干活、反应快、还便宜。
一、能干活:智能体能力登顶
先看硬指标。
image.png
在权威评测机构Artificial Analysis的语音到语音指数中,Think Fast 2.0高推理版本拿到82.9%的综合得分,比上一代的75.7%提升了7.2个百分点。
真正让行业炸锅的是智能体能力测试。
在衡量语音智能体真实场景表现的Tau Voice基准测试中,Think Fast 2.0以56.5%的得分排名第一。什么概念?它击败了OpenAI的GPT-Realtime-2.1 High(45.7%)、谷歌的Gemini 3.1 Flash(37.7%)。
image.png
56.5%这个数字看起来不高,但这是真实客服场景下的端到端测试——模型要自己理解问题、调用工具、完成多轮对话。能过一半就已经是行业第一了。
其他指标同样亮眼。语音推理测试Big Bench Audio拿到97.2%,多人实时对话的Full Duplex Bench达到95.1%,比上一代77.8%提升了一大截。
SpaceXAI软件工程师Parker Conrad发文说:“模型的智能水平、准确性和能力几乎让人感觉不真实”。
二、反应快:0.7秒响应,边说边推理
如果说智能体能力是“脑子好用”,那响应速度就是“嘴皮子利索”。
Think Fast 2.0平均首次音频响应时间仅0.70秒,是Artificial Analysis榜单前五名中唯一低于1秒的模型。
对比一下竞品:GPT-Realtime-2 High是1.14秒,GPT-Realtime-2.1 High是1.21秒,上一代Think Fast 1.0是1.25秒。0.70秒对1.21秒——差距将近一倍。
这背后是技术路线的差异。
传统语音模型走的是“语音识别→大模型推理→语音合成”三步走,用户说完话要等全套流程走完才能听到回复。Think Fast系列支持边说边推理——用户还在说话的时候,模型已经开始处理了。
更厉害的是推理效率。 新模型的中位数推理Token消耗只有上一代的40%左右。这意味着工具调用通常能在模型第一句话还没说完时就开始执行。
image.png
此外,团队用大量强化学习数据训练模型更接近真人对话——多用短句、一次只问一个问题、不啰嗦不重复。用户感觉不到等待,交流更自然。
AI公司Helionova AI的CEO Nick White实测后说,Think Fast 2.0相比前代“绝对是一次飞跃式的进步”。另一位开发者把它集成进终端工具,连续发出切换主题、切屏幕等指令,模型对答如流。
三、识别准:噪音环境下优势扩大10倍
语音模型光快不行,还得听得准。
SpaceXAI在覆盖24种语言、数千条短语的测试中发现,Think Fast 2.0的转录准确率比上一代提升约1.4倍,比Deepgram Nova 3和ElevenLabs Scribe v2等专业语音转文字模型提升约1.5到2倍。
更关键的是真实场景。在背景噪音大、电话压缩等复杂环境下,优势进一步扩大到约10倍。
客服电话、嘈杂环境中的语音交互——这才是模型真正要干活的地方。
四、价格砍半:每分钟0.08美元
能力升级了,价格呢?
Think Fast 2.0定价为每分钟音频0.08美元,约合每小时4.80美元。比上一代的3.00美元/小时确实涨了,但横向对比竞品——
GPT-Realtime-2.1 High是10.75美元/小时。
每小时便宜了近6美元,便宜了约2.2倍。
image.png
有分析指出,SpaceXAI正把语音作为独立基础设施层进行商业化。4月已开放语音API,7月1日推出无需编码的语音代理构建平台。这次Think Fast 2.0的发布,是这套商业布局的关键一步。
按照计划,8月5日默认模型grok-voice-latest将自动从1.0升级到2.0,开发者无需修改提示词。想继续用旧版本的得提前锁定。
五、行业信号:语音模型竞争进入“智能体时代”
这次发布不只是产品升级,更折射出整个行业的方向变化。
过去一年,OpenAI、Google、阿里千问都在猛推实时语音模型。但竞争焦点已经变了——从“能不能听懂”转向“能不能办事” 。
Think Fast 2.0在Tau Voice上登顶,恰好卡在这个转折点上。
Gartner2026年数据显示,企业应用中嵌入AI智能体的比例从2025年的不足5%,一年内暴涨到40%,翻了8倍。客服、销售、电话助手——这些真实业务场景正在被语音智能体重塑。
SpaceXAI已经在星链客服中做了A/B测试,销售转化率和客服自动解决率都有明显提升。
从整个市场看,全球AI语音模型赛道持续升温。中国AI语音模型市场预计2026-2032年复合增长率超过20%。而全球语音软件算法市场预计从2025年的87.6亿美元增长到2032年的340.1亿美元。
蛋糕在变大,分蛋糕的人也越来越多。
Think Fast 2.0用0.7秒的响应速度、56.5%的智能体得分、4.80美元/小时的价格,给自己在牌桌上抢了个好位置。
但问题也摆在面前:56.5%的通过率意味着还有将近一半的真实场景搞不定。语音智能体从“能用”到“好用”,路还长。

回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册 |

本版积分规则

主题 73 | 回复: 74

QQ|联系我们|法律声明|用户协议|AMT咨询|商务合作|会员入驻|积分充值|积分商城|积分奖励规则|TradEx全球购|加入QQ技术群|添加企业微信|加入微信技术群|智造号|手机版| 世界先进制造技术论坛™(简称AMT™, 智造云™) ( 沪ICP备12020441号-3 ) |Sitemap

GMT+8, 2026-9-15 07:27 , Processed in 0.116799 second(s), 50 queries .

论坛声明:AMT-智造云(世界先进制造技术论坛) 属纯技术性论坛,我们严格遵守《中华人民共和国网络安全法》、《个人信息保护法》等国家相关法律法规,请勿发布非法言论、非法广告等信息,多谢合作。
本论坛言论纯属发表者个人意见且会员单独承担发表内容的法律责任,与本论坛立场无关;会员参与本论坛讨论必须遵守中华人民共和国法律法规,凡涉及政治言论、色情、毒品、违法枪支销售等信息一律删除,并将积极配合和协助有关执法机关的调查,请所有会员注意!
本论坛资源由会员在本论坛发布,版权属于原作者;论坛所有资源为会员个人学习使用,请勿涉及商业用途并请在下载后24小时删除;如有侵犯原作者的版权和知识产权,请来信告知,我们将立即做出处理和回复,谢谢合作!

合作联系: 双日QQ客服:3419347041    单日QQ客服:3500763653    电话021-37709287    合作问题投诉:QQ:2969954637    邮箱:info@amtbbs.org    微信公众号:AMTBBS

 

快速回复 返回顶部 返回列表