AMD想让人人“Token自由”?

AMD高级副总裁、计算与图形总经理Jack Huynh。图片经过AI处理
文|苏扬
编辑|徐青阳
“AI PC是个人计算的基础设施,而非云端AI的替代品。”
1月份,苏姿丰在CES展上说要押注AI个人计算,当时AMD拿出的解决方案是128GB的Ryzen AI Halo。
8个月之后,AMD决定为个人计算基础设施的配置进一步加码,正式拿出新一代Gorgon Halo芯片,把统一内存从128GB拉到192GB,允许用户在本地部署3000亿参数模型。
AMD的升级策略直指英伟达,后者针对个人AI计算推出的DGX Spark芯片,统一内存为128GB,本地部署的模型也仅能支持到2000亿参数规模。
今年9月初的IFA(柏林国际消费电子展),AMD高级副总裁、计算与图形总经理Jack Huynh在主题演讲中将苏姿丰的观点进一步延展,强调AI正在进入“个人AI(Personal AI)”时代,智能不再只待在云端的数据中心,而要落到你手边的电脑、背包里的笔记本,乃至桌面上那台能跑万亿参数模型的工作站。
如果数据中心GPU是英伟达的核心战场,那么到了服务器CPU市场,AMD强势吃掉了这个领域的“半壁江山”——EPYC今年一季度按营收算拿下46.2%份额。
在这种背景下,聚焦本地计算的个人AI市场,将成为上游芯片公司们掘金的新战场,这也是为什么苏姿丰在多个场合谈到AI时会提及“我们才在第三局”,她也预测称2030年全球活跃AI用户将从10亿涨到50亿。
Counterpoint的跟踪数据也为“个人AI”的芯片战争提供了指引:数据显示,2026年高端AI PC在全球出货渗透率将冲到约59%,较2025年的39%大幅跳升。
因此,Counterpoint也将今年定义为硬件赶上软件的“交叉之年”。

Token处理量进化曲线
在演讲中,Jack Huynh把“个人AI”划分为三部分:本地计算、隐私与控制、“个人上下文”。并且把对用户规模的预测,量化到Token级别。
“每月处理量从约0.7千万亿涨到1.7千万亿,2030年预计达120千万亿。按每天1500万输出Token,纯云端成本每天约300欧元、一年近10万欧元。”
也就是说,把部分计算搬回本地设备,“聪明的计算”将转换成“更便宜的计算”。
为此,AMD组建了一个“个人AI”联盟,基于Gorgon Halo芯片延伸出联想ThinkCentre X、惠普ZBook,以及算力更加激进的Threadripper Halo Station等。

代号Sunday的惠普ZBook
“个人AI”的叙事能够成立,把云端订阅才能推进的工作转移到本地,硬件规格的提升只是一方面。另一方面取决于模型的进化。
“AI正变得越来越小、越来越快,同时功能越来越强大。”Jack Huynh说,这种效率提升会直接落到PC上。不过他也强调,本地并不意味着次等选择。
在软件工程基准上,本地部署在Strix Halo上的开源模型Laguna S 2.1,分数压过了云端模型Claude Sonnet 5;Gorgon Halo本地运行的GLM 5.3 Flash,也胜过云端领先的Claude Fable 5。
经济性上,Sonnet 5的1000万输出Token大约要90欧元,在Gorgon Halo上高用量场景跑同样规模,虽然按Token量计费约500欧元,但本地不涉及按次计费,换句话说,支付硬件成本之后,用户就将获得持续的“Token自由”。
除了联想等OEM伙伴的展台外,微软也提供了软件层面的支持。
微软副总裁、Windows与设备部门负责人Pavan Davuluri在与Jack Huynh的同台交流中提到
Agent从“理解意图”变成“跨应用、文件和服务采取行动”,前提是建立在信任、安全和用户控制之上。
与此同时,Pavan还宣布一套叫Project Zenith的“开箱即用”Windows编程体验,预装VS Code、WSL、GitHub Copilot CLI和PowerShell,并明确“开箱即用地支持AMD Ryzen AI Halo”,让开发者在本地跑大模型和复杂AI工作流。
不过,“算力压到个人身边”推到极致的,是Threadripper Halo Station工作站。
Threadripper Halo Station配备96核Threadripper PRO处理器、2块Instinct MI350P加速器(可扩至4颗)、最高2TB系统内存、最高576GB HBM3E,全部采用液冷方案,支持万亿参数模型本地部署。

Threadripper Halo Station现场图
从基于Gorgon Halo的AI PC,到Threadripper Halo Station工作站,AMD想要为“个人AI”争取的Token自由,实际上给用户的是一个阶梯选择。
同时,由于模型会变、工具会变、基础设施也会变,开发者也拥有“选择自由”——工作负载适合本地就选本地、适合数据中心就用数据中心。
“每一个伟大的计算时代,都赋予了人们过去所不具备的能力。而现在,AI正在赋予我们一种全新的能力。”Jack Huynh说。
以下为Jack Huynh演讲中文实录(在不改变原意的情况下,有删减)
早安,IFA。
几十年来,我们不断让电脑变得更快、更小、更强大。我们把电脑放在办公桌上,也放进我们的口袋里。现在,我们正在把智能融入每一个地方。我们正在赋予电脑一种理解能力——理解我们正在做什么、想要实现什么、什么对我们而言最重要,并最终与我们协同工作。而这将改变一切。
在AMD,我们构建支撑这一切可能性的计算能力,从最小的设备一直延伸到全球最大的超级计算机。我们一直在解决计算领域最困难的问题,同时始终相信一个简单的理念:技术只有真正将更多能力交到人们手中时,才最有价值。今天,我想向大家展示,当这种能力变得更加个性化之后,会发生什么。
从太空边缘,到手术室,再到我们星球的未来,AMD技术正在为这一切提供动力。计算不仅仅改变机器能够做什么,它也改变了人能够做什么。
AI就是新时代的电力。正如电力最终融入日常生活,智能也将融入我们每天使用的工具之中。AI正进入我们生活的方方面面,帮助我们发现新药、看到过去无法看到的东西、把想法变成现实。
每一代人都会把一套更强大的工具留给下一代。PC将计算能力交到数百万人手中;互联网让全球知识触手可及;智能手机把计算放进我们的口袋。而现在,AI正在赋予计算智能。问题不再只是“电脑能够做什么”,而是“我们能够利用电脑做什么”。
AI正以人类历史上极为罕见的速度发展。几年前AI学会对话,一年后学会“看”,然后学会推理,2025年进入Agentic阶段——它不再只是回答问题,而成为能够采取行动的系统:能规划、使用工具、检查自己的工作并持续执行。一个Agent帮一个人做更多工作,一组Agent并行工作,倍增效应不断扩大。
但这种新杠杆有代价。每次生产力倍增,都伴随计算需求倍增。Agentic AI正以前所未有的速度推动Token消耗增长。标准ChatGPT一次交互只用几百到几千Token;而一个自主Agent规划一次旅行,可能是数十万、数百万Token,且全天候发生。
我们每天使用的标准模型,每月处理的Token从约0.7千万亿增加到1.7千万亿,这还是Agent出现之前。到2030年,预计每月达120千万亿。差距巨大,我们需要更多计算,也需要重新思考这些计算在哪里运行。
93%的企业都超出了自己的AI预算,Agent只会进一步增加需求。我们不能只是花更多钱,必须更聪明地计算。按每天1500万输出Token,云端成本约每天300欧元、一年近10万欧元。与此同时,芯片更小更强,个人设备能力已进入过去只有数据中心才有的范围。下一代计算将由离你更近的智能定义——更个人化、更高效、更有能力。
我们正在进入个人AI时代。个人AI理解你的上下文,与数据紧密连接,扩展你的想象力和成就。它包含三个核心部分:本地计算、隐私与控制、个人上下文。
先看本地计算。去年8月OpenAI发布1200亿参数开放权重模型GPT-OSS,GPQA拿80分;几个月后90亿参数的Qwen 3.5在同一基准超过它——参数少13倍,成绩更好。AI正越来越小、越来越快、功能越来越强。Strix Halo用128GB统一内存,本地跑最高2000亿参数;Gorgon Halo把统一内存提到192GB,本地可跑从2000亿提升到3000亿参数。过去需云端订阅的,现在直接在电脑上完成。
本地并不意味着次等选择。软件工程基准上,跑在Strix Halo上的开源模型Laguna S 2.1胜过了云端Claude Sonnet 5;Gorgon Halo本地运行的GLM 5.3 Flash也胜过云端Claude Fable 5。经济性上,Sonnet 5生成1000万输出Token约90欧元,Gorgon Halo高用量场景约500欧元——但本地没有按Token计费,用一次或一千次都行。在Strix Halo上,10个AI Agent可在本地并行工作,笔记本变成与你协作的团队。
我身后就是Gorgon Halo Box,专为开发者打造、探索本地AI新品类,很快将在欧洲上市。OEM伙伴也很兴奋。
昨天联想在柏林推出由Gorgon Halo支持的ThinkCentre X,小巧可放桌面,能本地跑3000亿参数模型。我们还首次借助Gorgon Halo打造了一款笔记本,代号Sunday,研发数年——新一代惠普ZBook,190GB统一内存。整个3D世界可一条指令在本地创建,飞行模拟也能流畅跑。这就是掌握在手中的个人AI。
模型和设备都就绪,前沿技术不再遥不可及。但个人AI还必须赢得信任,这引出隐私与控制。个人AI触及你最有价值的部分——文件、对话、偏好。智能离你越近,保护这种个性化智能越重要。敏感工作应留在设备上、由你掌控;你的上下文随你选择的设备移动,只在你选择时分享。今天多数AI从云端开始,但想象智能从你身边开始:PC本地处理能处理的,需要更大规模时再连云端,由PC决定工作在哪里运行。
个人AI最后一个组成部分是个人上下文。最强大的AI不只了解更多世界,也更了解你。计算技术栈有应用、模型、计算,但个人AI还需多出一层上下文——告诉你你是谁、什么重要、在努力实现什么。没有上下文,AI只给一个答案;有了上下文,才给适合你的正确答案。两人问“帮我准备明天的事情”,一人意味着客户会议和三个决定,另一人意味着考试——同一问题,需求完全不同。
我们与微软合作近20年,共同把Strix Halo、Gorgon Halo不断往前推——更强CPU、GPU、AI、每瓦性能与安全,AMD持续交付。微软推出Project Zenith,一套开箱即用的Windows编程体验,将开箱即用地支持AMD Ryzen AI Halo,至少配64GB内存,让开发者本地跑大模型和复杂AI工作流;我们期待率先在Gorgon Halo Box上提供这一体验。
过去需云端的事,现在直接在PC本地运行。PC正在从响应你的工具,演进为理解你、帮你完成任务的对象,这需要芯片到软件到操作系统到应用协同。
我们刚讨论了AI如何改变PC,但当一个系统能成为工作所需的任何形态时会发生什么?如果PC不必只是PC,如果系统能为开发者提供卓越算力、并在团队需要时成为共享AI基础设施,如果把现代数据中心级算力带到身边?我们设计并建造了它。
今天首次分享一个全新类别——Threadripper Halo Station,世界上最强大的工作站,能跑参数超万亿的AI模型。它配96核Threadripper PRO、2块Instinct MI350P(可扩至4颗)、最高2TB系统内存、最高576GB HBM3E,全部液冷——几乎就是你的个人超级计算机。
我们从个人AI起步,用Gorgon Halo把卓越算力带到桌面,又把超算级算力带到工作站。现在需要让这种算力开放、可访问、为世界准备好,这需要软件和生态。
如何让PC和工作站的个性化能力进一步扩大?工作站并不是终点,只是起点。真正的转变是:开发者的想法从一台Ryzen AI Halo起步,进入安全受支持的生产环境,再随需求扩展成企业级基础设施。规模化不应意味着放弃选择——模型、工具、基础设施都会变,开发者和企业该始终握有主动权。AMD拥有同样的开放基因,我们希望始终开放,不缩小选择空间。
更大的机遇在于让数百甚至数千套AI系统——工作站、服务器、数据中心、边缘——协同工作,而非各自独立。从一台系统扩展到多台,保持开放,让所有算力无缝协同。一个想法从一个人、一台工作站开始,最终成长为整个组织依赖的解决方案。
每一个伟大的计算时代,都赋予人们过去不具备的能力。PC让计算触手可及,互联网连接全球知识,智能手机让它随行。而现在,AI赋予我们一种全新能力——将想象转化为行动。
AI理解你、与你协作、拓展你的能力边界,不是取代你的想象力,而是延伸它。最重要的问题不是“AI能做什么”,而是“你将用AI做什么”。最伟大的突破尚未被想象,下一家伟大的公司还未成立。也许就在这个房间,也许就是你。去想象一些尚不存在的东西,然后,把它创造出来。当你认为自己已触及极限时,再去想象、去梦想更大的可能。最好的未来,仍等待我们去想象。
推荐阅读

苏姿丰坚定“看多”AI算力

苏姿丰“中国行”爆火,她在现场回应了7个关键问题

