智东西(公众号:zhidxcom)




编译 |  王涵




编辑 |  心缘



智东西9月3日消息,昨晚,谷歌发布其


迄今为止最强的推理与编程模型




Gemini 3.8







在保持低成本的同时,Gemini 3.8在


定量及专业领域


以及


端到端自主解决复杂工程问题


方面,有了进一步提升。



谷歌DeepMind研究员姚顺宇说:“(这次模型发布)对模型来说是一小步,对RSI(递归自我改进)来说却是一大步。”



“美国豆包”又又又更了,15%价格叫板Opus 5,姚顺宇高度评价



新推出的Gemini 3.8包含两款模型:






  • Gemini 3.8 Flash


    :主力模型,上下文窗口为


    100万个token


    ,在软件工程、智能体任务以及专业领域中的关键多步推理等方面,相较3.7 Flash均有明显提升。




  • Gemini 3.8 Flash Cyber


    :网络安全模型,在漏洞检测和自动修补方面达到前沿水平,将通过全新的Fairwind计划向受信任的防御者开放。



两个模型共享同一套基础智能,由


长时运行的Agentic loop


进一步加速。这类loop用于递归评估和优化底层模型,使该共享核心的编程、推理能力获得显著提升。



基准测试方面,Gemini 3.8 Flash在14项测试中有


8项成绩排名第一





超过了Claude Opus 5和GPT-5.6 Sol


,分别是金融分析测试Vals Finance Agent v2、法律工作流测试Harvey Legal、终端代码测试Terminal-bench 2.1、复杂图表推理CharXiv、长视频理解LVBench以及跨学科专家难题HLE-Verified、生物学真实科研任务LABBench2。



在Artificial Analysis智能指数上,Gemini 3.8 Flash取得


59分





与GPT-5.6 Sol和Grok 4.6的非最高推理配置持平





在推理成本上,Gemini 3.8 Flash(high)每个智能指数任务成本为


0.58美元


,是在


同等级智能水平下成为最便宜的模型


。中等推理模式下,Gemini 3.8 Flash的每任务成本降至


0.41美元


,低推理模式下降至


0.24美元





“美国豆包”又又又更了,15%价格叫板Opus 5,姚顺宇高度评价
价格方面,Gemini 3.8 Flash目前采用优惠定价,为


每百万输入token 0.75美元、每百万输出token 3.75美元


,其标准定价为


每100万输入token 1.5美元、每100万输出token 7.5美元





对比来看,Claude Opus 5定价为输入每百万Token 5美元、输出每百万Token 25美元,是Gemini 3.8 Flash标准定价的


3


倍多。




GPT-5.6 Sol定价为输入每百万Token 5美元、输出每百万Token 30美元,是Gemini 3.8 Flash标准定价的


3到4倍


;Terra定价为输入2.5美元、输出15美元,约为Gemini 3.8 Flash标准定价的


2倍


;Luna定价为输入1美元、输出6美元,则更为便宜。



“美国豆包”又又又更了,15%价格叫板Opus 5,姚顺宇高度评价



在外网,已经有不少开发者体验了Gemini 3.8 Flash。



有开发者对比了Gemini 3.8 Flash和Claude Opus 5。对于同一个海浪模拟器任务,

Opus 5耗时24分钟,


3.8 Flash仅用了37秒,但Opus 5的成果细节处理较完善。



“美国豆包”又又又更了,15%价格叫板Opus 5,姚顺宇高度评价




该开发者对此很乐观,说:“如果给Gemini和Opus 5相同的时间,Gemini在质量上也会把Opus彻底碾压。”



“美国豆包”又又又更了,15%价格叫板Opus 5,姚顺宇高度评价



外网AI模型测评博主Lumina对比了Gemini 3.8 Flash、Gemini 3.7 Flash、GPT-5.6 Sol和Grok 4.6,全部开到最高配置,用同一套提示词生成罗马斗兽场,结果如下:



“美国豆包”又又又更了,15%价格叫板Opus 5,姚顺宇高度评价



Lumina评价称:“Gemini 3.8 Flash比Gemini 3.8 Flash明显清爽利落得多,说实话也是这里面生成质量最好的之一。谷歌这次升级确实不错。”



“美国豆包”又又又更了,15%价格叫板Opus 5,姚顺宇高度评价



在官宣推文的评论区中,多数用户留言期待Pro版本模型发布。



“美国豆包”又又又更了,15%价格叫板Opus 5,姚顺宇高度评价
“美国豆包”又又又更了,15%价格叫板Opus 5,姚顺宇高度评价



与谷歌前后脚,Meta在今日凌晨发布了


Muse Spark 1.3





在Artificial Analysis智能指数排行上,Muse Spark 1.3超越了Gemini 3.8 Flash(high),仅次于Claude Fable 5.1和Claude Opus 5。



Meta首席AI官、超级智能实验室创始人Alexandr Wang(汪涛)转发了该推文,还明呛谷歌:“gemini是谁?”



“美国豆包”又又又更了,15%价格叫板Opus 5,姚顺宇高度评价



一、


一句话生成可交互DOS版谷歌地图,但鹈鹕脚踩不到单车上




Gemini 3.8 Flash能在8项基准测试中超过


Claude Opus 5和GPT-5.6 Sol,表现着实亮眼,那


Gemini 3.8 Flash在实际应用中表现如何呢?



在博客中,谷歌团队放出了几个Gemini 3.8 Flash的实测案例:



Gemini 3.8 Flash仅凭一个简单的提示词,配合Google Antigravity中的循环指令,就构建出了这款游戏。该游戏融合了谜题、环境叙事,并利用Nano Banana生成的纹理,打造出一个


沉浸式3D关卡


,玩家将扮演一位巫师在城堡中探索穿行。



“美国豆包”又又又更了,15%价格叫板Opus 5,姚顺宇高度评价




Gemini 3.8 Flash还可以仅凭单个提示词,就构建出了一个


功能完整的DOS版谷歌地图


,完全可交互,


支持地点查询、路线规划和街景浏览






“美国豆包”又又又更了,15%价格叫板Opus 5,姚顺宇高度评价



用户可以使用美国地质调查局的真实数据集,用Gemini 3.8 Flash构建


地形图


,并可在其中探索


实时横截面、2D投影以及科学解释





“美国豆包”又又又更了,15%价格叫板Opus 5,姚顺宇高度评价



Hardware Anatomy是一个由Gemini 3.8 Flash构建的交互式3D可视化工具,能够


生成符合物理尺寸比例的硬件设备拆解图


,并基于Three.js实现逼真渲染。它可以自动将设备分解为多个层级,用户可通过拆解滑块进行展开和查看。



“美国豆包”又又又更了,15%价格叫板Opus 5,姚顺宇高度评价



在X上,有很多开发者发出了自己用Gemini 3.8 Flash做出的成果。



中国AI博主Chasen实测了“鹈鹕踩单车”,感叹称:“这输出速度简直了,其实 10s 就把整体代码写完了,后面的是验证和再输出一次。”



可以看到,Gemini 3.8 Flash生成的内容在整体画面色彩上比较协调,体现出来了单车在向前行驶。但美中不足的是鹈鹕的脚并没有踩在单车踏板上,自行车框架与车轮也错位了。



“美国豆包”又又又更了,15%价格叫板Opus 5,姚顺宇高度评价



还有开发者用Gemini 3.8 Flash生成了纯Three.js的DeBerti Design 2019 款福特F-250 “Transformer” 工作卡车,3D汽车模型各组件齐全,还可以进行交互。



“美国豆包”又又又更了,15%价格叫板Opus 5,姚顺宇高度评价



目前,Gemini 3.8 Flash可以通过Google AI Studio、Android Studio或Gemini API直接调用,开发者也可以在Google Antigravity和Stitch里体验智能体工作流。



企业用户在Gemini Enterprise中使用Gemini 3.8 Flash。订阅了AI Pro或 Ultra的普通消费者可以在Gemini应用、谷歌搜索的AI Mode以及谷歌表格里体验该模型。



二、编程、金融、法律、多步推理全领先,每任务成本仅0.58美元



回过头来,我们再来看看Gemini 3.8 Flash在基准测试上的具体表现。



在长周期软件工程基准测试DeepSWE v1.1上,Gemini 3.8 Flash在


端到端自主解决复杂工程问题方面


的表现超过了大多数更大的前沿模型,而成本却比其他模型降低许多。



“美国豆包”又又又更了,15%价格叫板Opus 5,姚顺宇高度评价



此外,在专业知识领域。Gemini  3.8 Flash在


需要


高级分析和报告能力的定量及专业领域


,如Vals Finance Agent V2和Harvey法律智能体基准中,Gemini 3.8 Flash的表现均优于Gemini 3.7 Flash和其他前沿模型。



“美国豆包”又又又更了,15%价格叫板Opus 5,姚顺宇高度评价



“美国豆包”又又又更了,15%价格叫板Opus 5,姚顺宇高度评价



Gemini 3.8 Flash在人类最终测试HLE-Verified基准上还取得了


54.9%


的成绩,证明了其在STEM、人文学科和专业领域中进行多步推理的能力。



“美国豆包”又又又更了,15%价格叫板Opus 5,姚顺宇高度评价



在任务完成速度上,在高推理模式下,Gemini 3.8 Flash的平均输出速度约为


每秒300个token


,每任务耗时


2.5分钟


,略优于GPT-5.6 Luna和 GPT-5.6 Terra。在低推理模式下,Gemini3.8 Flash的任务耗时缩短至


0.8分钟


,在“智能水平vs.每任务耗时”的权衡中


达到了帕累托前沿





“美国豆包”又又又更了,15%价格叫板Opus 5,姚顺宇高度评价



四、漏洞发现能力超GPT-5.6 Sol,2小时挖出人工数月发现的漏洞



与Gemini 3.8 Flash一同发布的,还有专注于安全领域的Gemini 3.8 Flash Cybe。



Gemini 3.8 Flash Cyber在用于漏洞发现的标准行业基准CyberGym上,


超越了GPT-5.6 Sol、Mythos 5和GPT-5.5-Cyber





“美国豆包”又又又更了,15%价格叫板Opus 5,姚顺宇高度评价



此外,谷歌团队还在一个更加全面的内部基准上评估了Gemini 3.8 Flash Cyber,该基准要求模型在涵盖20种编程语言的复杂代码库中发现各种漏洞。在这一评估中,该模型的


成功率超过70%


,相较谷歌前代模型能力大幅提升。



“美国豆包”又又又更了,15%价格叫板Opus 5,姚顺宇高度评价



谷歌团队分享称,在开发Gemini 3.8 Flash Cyber时,他们重点致力于


为防御者赋予专家级能力


,使其在面对攻击者时占据主动。正因如此,谷歌团队从一开始便将


漏洞修复


作为模型的投入重心,并优先于漏洞利用等攻击性能力。



在外部补丁能力测试CWE-Bench上,Gemini 3.8 Flash Cyber的


pass@1达47.2%


,而领先的前沿模型为47.8%,但前者的成本却显著更低。Gemini 3.8 Flash Cyber也已经处于帕累托前沿了。



在实际应用中,谷歌团队已率先将Gemini 3.8 Flash Cyber应用于谷歌内部代码的安全防护。



Chrome安全团队发现,Gemini 3.8 Flash Cyber为Chrome漏洞生成正确补丁的数量,是那些规模更大的顶尖商业模型的


2.6倍





Wiz公司在其内部渗透测试基准上的评估显示,Gemini 3.8 Flash Cyber的召回率比其他前沿模型


高出7.5~9.7个百分点


,而成本仅为后者的


2.3~5.2分之一





谷歌云漏洞研究团队则利用Gemini 3.8 Flash Cyber模型,在


不到2小时内


就发现了一个关键的基础性漏洞,而这类漏洞的常规研究和发现通常


需要耗费数月


之久。



目前,网络安全领域的受信任机构(政府、关键基础设施等)需要通过Fairwind计划单独申请访问Gemini 3.8 Flash Cyber。



结语:六周连发三版Flash,谷歌或押注递归自我改进



谷歌在六周内迎来了第三次Flash版本更新,其迭代速度之快令人瞩目。



然而,在技术快速迭代的背后,用户对旗舰级Pro版本的期待依然强烈。与此同时,Meta也在同日发布了Muse Spark 1.3,可以看出AI模型赛道的竞争之激烈。



对于谷歌而言,如何平衡发布节奏、满足不同用户群体的需求,并在激烈的市场竞争中持续保持技术领先,仍是值得长期关注的课题。



值得注意的是,谷歌DeepMind研究员姚顺宇的评价或许暗示了谷歌真正押注的方向,可能并非某一款具体模型,而是让模型能够自我迭代、自我进化的底层能力。