一周AI丨谷歌首次公开Gemini越狱事件;豆包二代手机开售;Claude Opus 5.2灰度上线;苹果Siri AI正式开放测试;Manus传融资5亿美元……

AI万象
首次设立CTO!迪士尼挖来原Character.AI首席执行官阿南德,强化AI布局
“豆包二代手机”努比亚NaviX Ultra正式发布,售价5499元起
大平台动作
深夜灰度上线的Claude Opus 5.2,响应快还治“偷懒病”!
苹果Siri AI终于来了!历经延期后正式开放测试
阶跃发布新旗舰Step 5 Preview,跻身AA榜单全球开源前三
新力量崛起
投融资风向
前DeepMind研究员创立的Emulate即将完成7亿美元种子轮融资,估值达37亿美元
Manus据报融资5亿美元,瞄准40亿美元估值
01
谷歌首次公开Gemini越狱事件:在测试中自主入侵三家真实公司
AI万象
9月19日,据路透社报道,谷歌公司的Gemini模型在一次网络安全能力测试期间接入互联网,入侵了三家企业的系统,这是谷歌AI模型实施此类入侵行为的首例已知案例。
这几起入侵事件发生在5月,当时独立网络安全评估机构Irregular正在开展网络安全测试。在一次标准测试评估过程中,Gemini在互联网上搜集公开信息,通过猜测账号凭证,访问了三个它认定属于测试范围内的网站。
谷歌称,在全部三起事件中,Gemini模型随后都主动停止了入侵操作,未造成实际损害,谷歌也向美国联邦部门报告了此事。谷歌安全工程副总裁阿德金斯表示:“我们已经告知三家公司相关情况,并协助合作测试方一起修改了测试流程。这些事件说明,训练高性能AI模型、使其能够做出负责任的行为,具有重要意义。”
另据《华尔街日报》报道,谷歌方面表示,此次Gemini的“越狱”事件是“身份误认”造成的。
事件起因于一次“夺旗”演练(Capture the Flag,一种网络安全竞赛形式,参与者在模拟环境中寻找并获取隐藏的“旗帜”以证明成功入侵),Gemini需要在Irregular提供的测试环境中,从一家虚构公司运行的软件里找到指定信息。而这家虚构公司与现实中的一家公司重名。
Irregular称,按照原有设计,Gemini无法访问互联网,但却意外地获得了互联网访问权限。
在第一起事件中,Gemini通过反复猜测密码,成功进入了一家企业的受保护系统。谷歌表示,模型随后判断自己面对的是真实公司,立即停止操作并退出。
另外两次发生在不同轮次的测试中。Gemini在网上搜索公司名称,找到两个公开存储库,其中包含其他公司的登录凭证。模型尝试使用这些凭证完成测试任务,成功进入系统后才意识到目标属于真实公司,并终止行动。
谷歌未公布遭到入侵的公司名称,也没有说明具体涉及哪一款Gemini模型,只表示此次事件与其最新模型无关。
Irregular的发言人表示,本次事件暴露的问题同样影响了其他多家AI实验室,所有相关实验室都在7月下旬收到了通知。该发言人说:“我们发现的全部问题,早在数周前就已经修复完毕。”
Irregular曾多次卷入在模型评估过程中,模型逃逸测试环境并入侵其他公司系统的事件。此前,Meta、Anthropic和OpenAI也披露了相关同类事件。
Meta在8月表示,相关事件并未出现沙箱逃逸或是复杂的网络攻击。Irregular称,谷歌的案例与其他事件并无二致,并非新出现的问题,该公司正在研究安全开展人工智能网络安全评估的最佳模式。
报道提到,自7月曝出Hugging Face遭入侵事件后,外界对新一代大模型网络安全能力的担忧持续加剧。第三方测评机构 METR在8月发布的报告披露,在该事件中,多达1200个智能代理在OpenAI内部的秘密留言板上协同行动,试图在测评中作弊。
上周末,Anthropic、OpenAI、谷歌以及SpaceX的负责人均达成共识,认为有必要放缓人工智能的研发推进速度,不过这些企业均未说明具体该如何落地。
新闻拓展:
谷歌Gemini,被曝“越狱”
02
首次设立CTO!迪士尼挖来原Character.AI首席执行官阿南德,强化AI布局
AI万象
当地时间9月18日,据美国CNBC报道,迪士尼宣布,原Character.AI CEO卡兰迪普・阿南德将于10月2日出任高级执行副总裁兼公司首位首席技术官(CTO),直接向迪士尼CEO乔希・达马罗汇报工作。
达马罗接掌迪士尼只有数月,此后一直强调利用技术推动公司各项业务发展。按照迪士尼的安排,阿南德将统管企业技术、基础设施、数据和AI平台,以及产品与工程业务,同时协调不同技术团队,进一步推动整个迪士尼的技术开发和交付方式现代化。
达马罗发表声明称:“卡兰迪普拥有基础设施、消费科技和AI领域难得的综合经验,将成为迪士尼高级管理团队的重要成员,帮助我们继续推进三项重点:以优秀叙事为北极星,让技术服务于创意,以及以‘一个迪士尼’的方式协同运营。”
据了解,阿南德拥有微软、Meta的资深技术管理背景,带领Character.AI打造面向普通用户的AI虚拟角色交互产品。此次人事变动中,部分Character.AI技术人员也将随同他加盟迪士尼。
颇具戏剧性的是,就在一年之前,迪士尼曾向Character.AI发出侵权告知函,抗议平台未经许可生成迪士尼IP角色,双方爆发版权矛盾,如今双方从维权对手变为上下级合作关系。
担任CTO后,阿南德将全面接管迪士尼企业技术、基础设施、数据体系、AI平台、产品及工程团队,统筹集团各业务板块技术团队,推动迪士尼技术架构现代化升级。公司提出“技术服务创意”战略,希望借助AI能力赋能影视内容、Disney+流媒体、主题乐园等核心业务,打造一体化粉丝数字体验。
新闻拓展:
首次设立CTO!迪士尼引入技术高管强化AI布局
03
AI万象
据介绍,努比亚NaviX Ultra兑现了“听得懂、能干活、记得住、够安全”四大核心能力。
听得懂上,努比亚NaviX Ultra搭载指纹AI按键,支持一键唤醒。实时通话模式下,还接入了最新Seed全双工语音大模型,支持随时打断与连续对话。目前已支持闽南语、客家话、上海话、粤语等十余种方言,以及英语等多语种交互。
能干活上,无需繁琐点击,一句指令即可触发任务。依托强大的模型能力,NaviX Ultra可深度推理、拆解复杂指令、自主规划执行步骤,并可实现数百步、长达数十分钟的长链路操作。此外,产品已拓展出行、音乐、地图等第三方服务生态,并持续完善可调用接口。
记得住上,在用户授权的前提下,努比亚NaviX Ultra能记住用户主动告知的偏好与习惯,构建专属个人记忆库。在用户开启授权的前提下,还支持通过自然语言查询本地信息,快速定位所需内容。
够安全上,努比亚NaviX Ultra配备锁屏安全策略,这颗带指纹鉴权的AI按键,兼顾便捷与安全。同时,智能体所有操作均在用户授权及系统安全框架内合规执行,严格遵循第三方隐私安全管理体系认证要求,符合国际标准。
发布会上,中兴通讯终端事业部总裁、努比亚总裁倪飞表示:“市场与用户的反馈让我们确信智能体手机这个方向是对的。努比亚将继续以开放的姿态推进多元合作,与更多同行者一起,把这条路走宽。”
努比亚NaviX Ultra搭载第五代骁龙8至尊版移动平台。存储部分,采用了长鑫、三星等最高速率达10667Mbps的LPDDR5X产品;续航方面,配备7100mAh第五代南海大电池,支持90W有线快充与50W无线充电。
屏幕方面,NaviX Ultra搭载由京东方BOE供应的6.78英寸超窄四等边屏幕,支持1-144Hz自适应刷新率,配备2160Hz高频PWM调光与全亮度DC调光双护眼方案;影像方面,2亿像素主摄、5000万像素超广角与6400万像素潜望长焦的旗舰三摄组合。
售价方面,12GB+512GB版本售价5999元,叠加国补后5499元起;16GB+512GB版本6499元,16GB+1TB版本7499元。
新闻拓展:
体验完最新的“豆包手机”,我只能说有些可惜。
04
大平台动作
两款新品分别为面向规模部署与成本优化的Gemini 3.8 Live,以及面向高复杂度任务、强化多步推理能力的Gemini 3.8 Live Extended Thinking。
Gemini 3.8 Live兼顾对话智能、流畅交流和视觉理解,面向规模化与成本效率。Gemini 3.8 Live Extended Thinking面向高复杂度任务,具备更强的智能和多步推理能力。
Gemini 3.8 Live Extended Thinking在多项基准测试中取得领先成绩,拿下Artificial Analysis语音对语音质量指数总排名第一(82.6%),在τ-Voice智能体任务完成率达68.6%,在Sierra的τ-Voice-banking基准测试达35.1%;推理能力方面,在Big Bench Audio得分97.7%,同时仍保持有竞争力的定价。
Gemini 3.8 Live则获得用户高认可度,在Speech Agent Arena排名第二,且具备出色成本效益,适合大规模部署。两款模型在ServiceNow(NOW) EVA-Bench语音智能体基准测试中,成功平衡准确性与对话质量,推高了复杂工作流的帕累托前沿。
Gemini 3.8 Live可近实时处理视觉输入,在对话中自动检测并切换97种支持的语言,还能在后台执行工具与API调用,同时保持对话流畅不中断。
针对需要深度推理的任务,Gemini 3.8 Live Extended Thinking可实现推理与发言同步进行,在不中断对话流畅度的前提下提升复杂工作流智能水平,通过“让我确认一下…”这类早期语言提示自然回应提示,还可实时讲解多步后台任务处理进度。
开发者可通过Gemini Live API,在声网(API)、Fishjam、LiveKit、Pipecat、Vercel、Vision Agents等平台轻松构建部署高性能语音驱动界面;谷歌还与Salesforce、Genspark、Lumeris等企业开展合作,共同推进生态建设。
谷歌所有AI生成音频都添加了SynthID隐形水印,直接嵌入音频输出,可检测AI生成内容,帮助防止虚假信息传播。
目前Gemini3.8Live已开始推送:开发者可在Gemini API和Google AI Studio使用;企业用户可在Gemini Enterprise抢先体验,即将登陆Gemini Enterprise(EFSC) for Customer Experience;全用户可在Search Live体验。
Gemini 3.8 Live Extended Thinking也已开启推送:开发者可在Gemini API和Google AI Studio使用;企业用户可在Gemini Enterprise抢先体验,即将登陆Gemini Enterprise for Customer Experience以及Google Workspace企业客户;普通用户可在Gemini Live体验,Google AI Pro和Ultra订阅者可在Google Workspace的Docs使用,所有Google AI订阅者可在Gmail和KEEP体验。
新闻拓展:
深度拆解 Gemini 3.8 Live:一句插话,为什么会牵动整个 Agent 系统
05
大平台动作
新闻拓展:
曝 GPT-6 Sol 和 Opus 5.2 本周齐发,AI 巨头嘴上喊刹车脚上踩油门
06
苹果Siri AI终于来了!历经延期后正式开放测试
大平台动作
新闻拓展:
苹果新品发布会,到处是AI...就是国内用不了
07
阶跃发布新旗舰Step 5 Preview,跻身AA榜单全球开源前三
大平台动作
据介绍,该模型采用稀疏MoE混合专家架构,总参数量600B、激活参数仅27B,支持100万Token上下文窗口,原生支持文本与视觉输入。
在全球人工智能权威榜单Artificial Analysis Intelligence Index(AA综合智能指数)中,该模型得分44分,位居全球开源模型前三。与此同时,该模型的单任务成本仅为Anthropic Claude Opus 5的1/8。
优化方面,阶跃为该模型建立了StepCodeBench,覆盖553个独立代码仓库、9类任务、20个应用领域和33种编程语言。在测试中,Step 5 Preview能够覆盖多种编程语言,以及Bug修复、功能开发、代码重构、环境配置等真实开发任务。
同时,该模型能根据自然语言需求,自主阅读ESP32设备及相关API的大量开发文档,将一块ESP32-S3开发板改造成支持蓝牙按键与语音输入的Vibe Coding键盘。它不仅能写代码,还可以访问串口、获取截图、调用摄像头、模拟鼠标操作,并根据真实设备返回的状态和报错持续修改、运行和调试代码,连续执行超过3小时。
在公开和内部评估中,Step 5 Preview在复杂的软件工程任务(包括长程规划任务)、专业知识工作和金融领域等基准测试中展现出较为均衡的综合能力,并在Agents' Last Exam的CLI子集ALE-CLI、金融投资研究评测FrontierFinance,以及跨领域深度研究评测DRACO上仅次于GPT-6 Astra或Claude Opus 5。
该模型从20日起全量开放,官方将于10月15日释放模型权重。
新闻拓展:
刚刚,阶跃Step 5 Preview发布!一举杀进全球开源前三
08
引爆AI圈:前OpenAI研究员发布全新AI模型,绕开文本生成,响应速度快200倍
新力量崛起
09
投融资风向
新闻拓展:
https://baijiahao.baidu.com/s?id=1876568766470243778&wfr=spider&for=pc
10
投融资风向
新闻拓展:
Manus重生第17天,估值居然就翻倍了
信息来源:WAIC综合整理



















