“美国豆包”又又又更了,15%价格叫板Opus 5,姚顺宇高度评价

智东西(公众号:zhidxcom)
编译 | 王涵
编辑 | 心缘
智东西9月3日消息,昨晚,谷歌发布其
迄今为止最强的推理与编程模型
Gemini 3.8
。
在保持低成本的同时,Gemini 3.8在
定量及专业领域
以及
端到端自主解决复杂工程问题
方面,有了进一步提升。
谷歌DeepMind研究员姚顺宇说:“(这次模型发布)对模型来说是一小步,对RSI(递归自我改进)来说却是一大步。”

新推出的Gemini 3.8包含两款模型:
Gemini 3.8 Flash
:主力模型,上下文窗口为
100万个token
,在软件工程、智能体任务以及专业领域中的关键多步推理等方面,相较3.7 Flash均有明显提升。
Gemini 3.8 Flash Cyber
:网络安全模型,在漏洞检测和自动修补方面达到前沿水平,将通过全新的Fairwind计划向受信任的防御者开放。
两个模型共享同一套基础智能,由
长时运行的Agentic loop
进一步加速。这类loop用于递归评估和优化底层模型,使该共享核心的编程、推理能力获得显著提升。
基准测试方面,Gemini 3.8 Flash在14项测试中有
8项成绩排名第一
,
超过了Claude Opus 5和GPT-5.6 Sol
,分别是金融分析测试Vals Finance Agent v2、法律工作流测试Harvey Legal、终端代码测试Terminal-bench 2.1、复杂图表推理CharXiv、长视频理解LVBench以及跨学科专家难题HLE-Verified、生物学真实科研任务LABBench2。
在Artificial Analysis智能指数上,Gemini 3.8 Flash取得
59分
,
与GPT-5.6 Sol和Grok 4.6的非最高推理配置持平
。
在推理成本上,Gemini 3.8 Flash(high)每个智能指数任务成本为
0.58美元
,是在
同等级智能水平下成为最便宜的模型
。中等推理模式下,Gemini 3.8 Flash的每任务成本降至
0.41美元
,低推理模式下降至
0.24美元
。

价格方面,Gemini 3.8 Flash目前采用优惠定价,为
每百万输入token 0.75美元、每百万输出token 3.75美元
,其标准定价为
每100万输入token 1.5美元、每100万输出token 7.5美元
。
对比来看,Claude Opus 5定价为输入每百万Token 5美元、输出每百万Token 25美元,是Gemini 3.8 Flash标准定价的
3
倍多。
GPT-5.6 Sol定价为输入每百万Token 5美元、输出每百万Token 30美元,是Gemini 3.8 Flash标准定价的
3到4倍
;Terra定价为输入2.5美元、输出15美元,约为Gemini 3.8 Flash标准定价的
2倍
;Luna定价为输入1美元、输出6美元,则更为便宜。

在外网,已经有不少开发者体验了Gemini 3.8 Flash。
有开发者对比了Gemini 3.8 Flash和Claude Opus 5。对于同一个海浪模拟器任务,
Opus 5耗时24分钟,
3.8 Flash仅用了37秒,但Opus 5的成果细节处理较完善。

该开发者对此很乐观,说:“如果给Gemini和Opus 5相同的时间,Gemini在质量上也会把Opus彻底碾压。”

外网AI模型测评博主Lumina对比了Gemini 3.8 Flash、Gemini 3.7 Flash、GPT-5.6 Sol和Grok 4.6,全部开到最高配置,用同一套提示词生成罗马斗兽场,结果如下:

Lumina评价称:“Gemini 3.8 Flash比Gemini 3.8 Flash明显清爽利落得多,说实话也是这里面生成质量最好的之一。谷歌这次升级确实不错。”

在官宣推文的评论区中,多数用户留言期待Pro版本模型发布。


与谷歌前后脚,Meta在今日凌晨发布了
Muse Spark 1.3
。
在Artificial Analysis智能指数排行上,Muse Spark 1.3超越了Gemini 3.8 Flash(high),仅次于Claude Fable 5.1和Claude Opus 5。
Meta首席AI官、超级智能实验室创始人Alexandr Wang(汪涛)转发了该推文,还明呛谷歌:“gemini是谁?”

一、
一句话生成可交互DOS版谷歌地图,但鹈鹕脚踩不到单车上
Gemini 3.8 Flash能在8项基准测试中超过
Claude Opus 5和GPT-5.6 Sol,表现着实亮眼,那
Gemini 3.8 Flash在实际应用中表现如何呢?
在博客中,谷歌团队放出了几个Gemini 3.8 Flash的实测案例:
Gemini 3.8 Flash仅凭一个简单的提示词,配合Google Antigravity中的循环指令,就构建出了这款游戏。该游戏融合了谜题、环境叙事,并利用Nano Banana生成的纹理,打造出一个
沉浸式3D关卡
,玩家将扮演一位巫师在城堡中探索穿行。

Gemini 3.8 Flash还可以仅凭单个提示词,就构建出了一个
功能完整的DOS版谷歌地图
,完全可交互,
支持地点查询、路线规划和街景浏览
。

用户可以使用美国地质调查局的真实数据集,用Gemini 3.8 Flash构建
地形图
,并可在其中探索
实时横截面、2D投影以及科学解释
。

Hardware Anatomy是一个由Gemini 3.8 Flash构建的交互式3D可视化工具,能够
生成符合物理尺寸比例的硬件设备拆解图
,并基于Three.js实现逼真渲染。它可以自动将设备分解为多个层级,用户可通过拆解滑块进行展开和查看。

在X上,有很多开发者发出了自己用Gemini 3.8 Flash做出的成果。
中国AI博主Chasen实测了“鹈鹕踩单车”,感叹称:“这输出速度简直了,其实 10s 就把整体代码写完了,后面的是验证和再输出一次。”
可以看到,Gemini 3.8 Flash生成的内容在整体画面色彩上比较协调,体现出来了单车在向前行驶。但美中不足的是鹈鹕的脚并没有踩在单车踏板上,自行车框架与车轮也错位了。

还有开发者用Gemini 3.8 Flash生成了纯Three.js的DeBerti Design 2019 款福特F-250 “Transformer” 工作卡车,3D汽车模型各组件齐全,还可以进行交互。

目前,Gemini 3.8 Flash可以通过Google AI Studio、Android Studio或Gemini API直接调用,开发者也可以在Google Antigravity和Stitch里体验智能体工作流。
企业用户在Gemini Enterprise中使用Gemini 3.8 Flash。订阅了AI Pro或 Ultra的普通消费者可以在Gemini应用、谷歌搜索的AI Mode以及谷歌表格里体验该模型。
二、编程、金融、法律、多步推理全领先,每任务成本仅0.58美元
回过头来,我们再来看看Gemini 3.8 Flash在基准测试上的具体表现。
在长周期软件工程基准测试DeepSWE v1.1上,Gemini 3.8 Flash在
端到端自主解决复杂工程问题方面
的表现超过了大多数更大的前沿模型,而成本却比其他模型降低许多。

此外,在专业知识领域。Gemini 3.8 Flash在
需要
高级分析和报告能力的定量及专业领域
,如Vals Finance Agent V2和Harvey法律智能体基准中,Gemini 3.8 Flash的表现均优于Gemini 3.7 Flash和其他前沿模型。


Gemini 3.8 Flash在人类最终测试HLE-Verified基准上还取得了
54.9%
的成绩,证明了其在STEM、人文学科和专业领域中进行多步推理的能力。

在任务完成速度上,在高推理模式下,Gemini 3.8 Flash的平均输出速度约为
每秒300个token
,每任务耗时
2.5分钟
,略优于GPT-5.6 Luna和 GPT-5.6 Terra。在低推理模式下,Gemini3.8 Flash的任务耗时缩短至
0.8分钟
,在“智能水平vs.每任务耗时”的权衡中
达到了帕累托前沿
。

四、漏洞发现能力超GPT-5.6 Sol,2小时挖出人工数月发现的漏洞
与Gemini 3.8 Flash一同发布的,还有专注于安全领域的Gemini 3.8 Flash Cybe。
Gemini 3.8 Flash Cyber在用于漏洞发现的标准行业基准CyberGym上,
超越了GPT-5.6 Sol、Mythos 5和GPT-5.5-Cyber
。

此外,谷歌团队还在一个更加全面的内部基准上评估了Gemini 3.8 Flash Cyber,该基准要求模型在涵盖20种编程语言的复杂代码库中发现各种漏洞。在这一评估中,该模型的
成功率超过70%
,相较谷歌前代模型能力大幅提升。

谷歌团队分享称,在开发Gemini 3.8 Flash Cyber时,他们重点致力于
为防御者赋予专家级能力
,使其在面对攻击者时占据主动。正因如此,谷歌团队从一开始便将
漏洞修复
作为模型的投入重心,并优先于漏洞利用等攻击性能力。
在外部补丁能力测试CWE-Bench上,Gemini 3.8 Flash Cyber的
pass@1达47.2%
,而领先的前沿模型为47.8%,但前者的成本却显著更低。Gemini 3.8 Flash Cyber也已经处于帕累托前沿了。
在实际应用中,谷歌团队已率先将Gemini 3.8 Flash Cyber应用于谷歌内部代码的安全防护。
Chrome安全团队发现,Gemini 3.8 Flash Cyber为Chrome漏洞生成正确补丁的数量,是那些规模更大的顶尖商业模型的
2.6倍
。
Wiz公司在其内部渗透测试基准上的评估显示,Gemini 3.8 Flash Cyber的召回率比其他前沿模型
高出7.5~9.7个百分点
,而成本仅为后者的
2.3~5.2分之一
。
谷歌云漏洞研究团队则利用Gemini 3.8 Flash Cyber模型,在
不到2小时内
就发现了一个关键的基础性漏洞,而这类漏洞的常规研究和发现通常
需要耗费数月
之久。
目前,网络安全领域的受信任机构(政府、关键基础设施等)需要通过Fairwind计划单独申请访问Gemini 3.8 Flash Cyber。
结语:六周连发三版Flash,谷歌或押注递归自我改进
谷歌在六周内迎来了第三次Flash版本更新,其迭代速度之快令人瞩目。
然而,在技术快速迭代的背后,用户对旗舰级Pro版本的期待依然强烈。与此同时,Meta也在同日发布了Muse Spark 1.3,可以看出AI模型赛道的竞争之激烈。
对于谷歌而言,如何平衡发布节奏、满足不同用户群体的需求,并在激烈的市场竞争中持续保持技术领先,仍是值得长期关注的课题。
值得注意的是,谷歌DeepMind研究员姚顺宇的评价或许暗示了谷歌真正押注的方向,可能并非某一款具体模型,而是让模型能够自我迭代、自我进化的底层能力。
