一周AI丨OpenAI、谷歌、SpaceXAI三连发;Ilya Sutskever首个模型曝光;林俊旸官宣创业方向;DeepSeek发布首款Agent产品……

AI万象
韩国AI模型Solar Pro 4首次亮相Agent Arena:排名44
大平台动作
谷歌发布Gemini 3.7 Flash,距Gemini 3.6仅三周
剑指GPT-5.6 Sol,SpaceXAI发布Grok 4.6模型
新力量崛起
投融资风向
AI初创公司Lovable融资4亿美元:估值133亿美元,腾讯跟投
01
Anthropic为Claude生成文本加入水印,部分用户退订
AI万象
8月15日,据《商业内幕》报道,Anthropic给Claude生成文本添加水印的做法,正在导致一些用户离开其AI助手。
Anthropic本周表示,部分版本的Claude将在输出文本中直接嵌入一种“不可察觉的水印”。Anthropic称,当内容被复制粘贴时,这种水印会随文本一起传播,并且在经过部分编辑后仍可能保留下来,从而帮助区分AI生成的内容和人类创作的文字。
Anthropic表示,水印不会改变Claude回复的含义、质量或可读性。被检测出的水印只能说明Claude处理过这段文本,并不意味着Claude一定是这段内容的原始作者。
这种区分并未消除部分用户的担忧。部分疑虑声音表示,在严格限制 AI 使用的学术和专业环境中,这种标记可能带来麻烦;不希望正式交付的代码带有隐形标记,从而引发作者身份、合规或客户政策方面的问题。
并非所有人都反对使用AI水印。一些人认为,随着越来越多的网络内容由AI生成,水印能够提高内容透明度。另一些人则表示,水印可能有助于防止AI系统被大量AI生成内容反复训练,因为这种情况可能导致模型性能下降。
高管沟通公司The Narrative Company的联合创始人阿迪特·谢思(Aadit Sheth)周二在X平台上表示,受众应该能够分辨他们所读的文字是否反映了一个人自己的思考,而水印是实现这一目标的一种方式。
Anthropic并非唯一使用水印的AI实验室。谷歌使用其SynthID技术为AI生成内容加水印,OpenAI则在其支持的图像和音频中使用SynthID。
马斯克旗下社交媒体X也会对其认定为由AI生成或经过篡改的内容添加“Made with AI”(由AI制作)标签。周三,该标签曾出现在即将离任的白宫新闻秘书卡罗琳·莱维特(Karoline Leavitt)的辞职帖子上,但随后消失。
Anthropic表示,其添加水印是为了遵守欧盟的《AI法案》,并计划推出一款免费的应用程序编程接口,允许用户和第三方自行检查文本是否带有Claude的水印。
Anthropic的水印功能自8月2日起,已在全球范围内应用于受支持的Claude模型生成的文本。
新闻拓展:
以后让Claude写的东西,可能要小心留暗底了。
02
韩国AI模型Solar Pro 4首次亮相Agent Arena:排名44
AI万象
8月13日,韩国人工智能实验室Upstage发布博文,宣布推出Solar Pro 4模型,定位为面向复杂AI智能体任务的商用大模型。
Solar Pro 4模型上下文窗口为512K,最高输出长度为128K token,支持用户在单次会话中加载多份合同、报告和数据文件,官方博文中暂未披露参数量相关信息。
定价方面,每100万Tokens输入价格为0.3美元,缓存读取(Cache Read)每100万Tokens输入价格为0.06美元,每100万Tokens输出价格为1.2美元。
智能体任务方面,Solar Pro 4的主要提升集中在更接近真实工作的评测上,包括长文档、终端任务和多轮工具调用。官方列出的3项核心结果为:Terminal-Bench v2.1得分57,τ³-Banking得分23,AA-LCR得分71。
Upstage以虚构咖啡品牌Solarbean Coffee的门店选址分析作为演示任务。输入材料包括1份门店开设政策文档和6份市场数据文件。Solar Pro 4在3条提示词内完成10个候选站点的政策筛选,并按顺序生成3类交付物:Excel工作簿、审查报告和幻灯片。
据公开资料,该模型已现身多家AI模型评测平台。Artificial Analysis是一家领先的国际独立AI基准测试与分析机构,专门针对大语言模型(LLM)、视频生成、AI 音乐等多领域进行无偏见的性能与托管成本评估。
Arena.ai是当前全球AI行业最权威的“人类偏好”大模型即时对战与评测平台。它源自著名的LMSYS Chatbot Arena团队,采用类似国际象棋的Elo积分系统,通过纯粹的人类开发者双盲盲测(Blind A/B Testing)来对全球AI模型进行高强度的淘汰赛排名。
该机构指出,Solar Pro 4是首个登上Agent Arena、Code Arena: WebDev和Text Arena排行榜的韩国实验室。
在Agent Arena榜单中,Solar Pro 4模型排名第44 位,与MiniMax M2.7和Nemotron 3 Ultra等模型处于同一水平。
新闻拓展:
https://www.upstage.ai/blog/en/solar-pro-4
03
大平台动作
在该模式下,GPT-5.6 Sol的输出速度最高可达750 tokens/s,相比目前Standard(标准)模式约53 tokens/s的推理基线,速度提升最高达14倍,同时不降低任何质量。横向对比,GPT-5.6 Sol加速后比Fable 5快11倍,比Opus 4.8在Fast模式下快5倍。
Ultrafast 模式将率先在 OpenAI API 中推出,当前已面向部分客户推出有限预览版。
OpenAI与Cerebras对当前先进AI大模型现在的速度和智力对比拉了个表格,GPT-5.6 Sol Ultrafast处于绝对领先的位置。
GPT-5.6 Sol在超快模式下仅用11小时11分钟就回答了“人类最后的考试”(Humanity's Last Exam, HLE)全部问题。而Claude Fable 5则需要78小时27分钟,也就是超过三天的连续计算才能得出相同的结论。GPT超快模式仅用一个工作日就完成了人类知识的前沿领域,在准确率相近的同时,速度几乎是Claude Fable的7倍。
随着模型能力的不断提升,快速推理的应用范围也会扩大。在GDP-Val(衡量经济价值知识工作任务的基准)上,Ultrafast实现了5.6倍的端到端速度提升,且质量未受影响,充分展现了更快的推理速度如何加速经济价值工作的开展。
Ultrafast模式的突破在于打破了传统GPU集群在大模型推理解码阶段的内存带宽瓶颈,其实现主要依赖于Cerebras的晶圆级硬件架构。
在AI芯片厂商行列中,Cerebras的解决方案独树一帜:其历代芯片采用整片晶圆制成,在单片上集成了海量计算核心与超高速互联网络。
传统GPU在运行大模型自回归解码生成Token时,受限于显存带宽,需要不断将庞大的模型权重在片外HBM和计算核心之间往返搬运;同时多卡切分还会带来跨芯片互连(PCIe/NVLink)的通信延迟。
而每块Cerebras最新的晶圆级芯片(WSE-3)集成了4万亿晶体管,125 petaflops的AI算力和高达44 GB的片上高速SRAM,模型参数直接全部常驻在超高带宽的片上SRAM中,避免了反复从片外内存加载权重的等待时间。
当然,GPT-5.6 Sol作为前沿旗舰模型,完整参数量显然远超芯片容量。Cerebras还有“多晶圆流水线并行”(Pipelined across wafers)机制,其将模型的各网络层分别分布于多颗晶圆上,每层参数常驻于各自芯片的SRAM中,能让Token在晶圆间无缝流水传输。
对于众多大模型用户来说,旗舰模型14倍速会意味着以前不少必须切换次级模型(如Luna和Terra)的任务现在可以直接放心地满血跑,对于需要多轮工具调用、代码生成排错和复杂链式思考的Agent任务,原本需要几小时的流程可压缩至几分钟完成。
新闻拓展:
一夜之间,GPT-5.6 Sol被OpenAI加速了14倍
04
大平台动作
Gemini 3.7 Flash支持文本、图像、音频与视频输入,上下文窗口维持在100万token,输出上限提升至约6.4万token,并引入可调的思考配置以灵活权衡质量、成本与响应速度。
谷歌称其为当前最智能的Flash级主力模型,在代码调试、生产级代码生成与多步骤任务执行等方面较上一代3.6 Flash明显提升。
编码方面,Gemini 3.7 Flash在DeepSWE v1.1基准测试中得分从49.0%提升至65.3%,在FrontierCode 1.1 Main中从34.4%提升至43.6%。网页开发方面,Arena.ai WebDev Arena评分从1538提升至1588。在金融、法律、生物科学等知识密集型领域,GDP.pdf基准测试得分从22.0%提升至34.0%,AutomationBench从17.0%提升至30.4%。
安全方面,该模型针对化学、生物、放射、核及网络攻击领域更新了防护机制。
价格成为本次发布的重要卖点。2026年底前,Gemini 3.7 Flash引导价为每百万输入token 0.75美元、输出3.75美元,均为3.6 Flash原价的一半;2027年1月1日起将分别恢复至1.50美元和7.50美元。谷歌旗下AI生产力智能体Gemini Spark自8月13日起由3.7 Flash提供支持。
目前该模型已在Google Antigravity、AI Studio、Android Studio等渠道上线。
与此同时,市场关注的旗舰模型Gemini 3.5 Pro仍未公布明确上线时间,引发外界对谷歌AI产品路线的讨论。
新闻拓展:
刚刚,Gemini 3.7 Flash 正式发布,谷歌真的急了
05
大平台动作
新闻拓展:
马斯克要用 Grok 4.6 挤进「御三家」
06
前OpenAI首席科学家Ilya的首个模型曝光
新力量崛起
新闻拓展:
Ilya的首个模型来了!
07
林俊旸官宣创业方向!20亿美金估值的语用科技杀向“数字”与“物理”的智能体
新力量崛起
公司官网列了两条业务线,一条面向知识工作的数字Agent,一条进入真实环境的物理Agent,目标覆盖知识工作、企业运营、工业流程及现实环境中的长期任务。
这可能是今年最受关注的一次前大厂技术高管创业。
林俊旸1993年出生,是阿里历史上最年轻的P10技术专家,执掌千问期间落地万亿参数Qwen3-Max,开源体系累计下载超6亿次,与智谱唐杰、月之暗面杨植麟、腾讯姚顺雨并称“基模四杰”。
今年3月他从阿里离职,五个月后官宣新公司。
曾援披露过其融资细节,天使轮即获高榕创投与红杉中国联合领投,各出资约1亿美元,腾讯跟投约2,000万美元,上海未来产业基金参与,投后估值约20亿美元。
林俊旸3月离职时发表长文《从推理式思考到智能体思考》,是理解这家公司的钥匙。
他的判断是,AI下一阶段的核心命题应从“训练模型”转向“训练智能体”,核心问题从“模型能否足够长时间思考”转向“模型能否以支撑有效行动的方式思考”,智能体式思维将取代静态独白式的推理思维。
其公司取名Pragmatik,来自他学习语言学时的pragmatics(语用学),也指实用主义,他认为AGI最终应走向真正解决问题、创造价值。
据媒体报道,融资将用于团队组建与两条业务线的研发。此前报道,林俊旸的AI实验室主攻世界模型与具身智能,绕开竞争激烈的基础大语言模型赛道;他在千问内部曾从零组建机器人与具身智能团队,认为多模态基础模型理应从虚拟世界走向现实世界。
林俊旸的官宣是今年大厂技术高管创业潮的最新一例。在他之前,月之暗面杨植麟、智谱唐杰等“基模四杰”成员均已下场,具身智能正成为大厂高管离职后的热门去向。
在多数创业者扎堆基础模型时,林俊旸押注的是智能体层与世界模型,模型能力决定智能体上限,Agent与具身智能是模型通往现实场景的出口。
天使轮20亿美元估值,背后是市场对“千问负责人”能力的定价,也是对Agent叙事的提前下注。
对语用科技而言,数字与物理两条业务线同时推进,考验的是团队能不能把最贵的人才和时间,花在真正能落地的方向上。
新闻拓展:
上海抢走林俊旸
08
DeepSeek发布首款Agent产品Harness
新力量崛起
09
新力量崛起
新闻拓展:
GLM-5.3发布,基座没变,能力却涨了
10
投融资风向
新闻拓展:
腾讯投了两位90后,估值900亿
信息来源:WAIC综合整理



















