OpenAI新突破:Ultrafast模式加持 GPT
OpenAI近日宣布推出GPT-5.6 Sol的全新加速档位Ultrafast,其处理速度较标准模式提升14倍,每秒可生成750个token。这一突破性进展并未牺牲模型性能,而是通过优化硬件架构与数据调度方式实现。目前该功能处于预览阶段,具体定价尚未对外公布。
技术实现层面,Ultrafast依托Cerebras的晶圆级计算引擎,将模型权重直接存储于芯片内置的44GB SRAM中。这种设计避免了传统GPU架构中频繁的显存数据搬运,突破了长期制约推理速度的带宽瓶颈。OpenAI与Cerebras的合作早有布局,双方今年初签署的十年协议计划部署750MW规模的晶圆级系统,总投资超百亿美元,此次推出的加速服务正是该合作的首个落地成果。
在金融交易场景中,Ultrafast展现出显著优势。系统报警时,工程师可同步分析日志、比对代码变更并制定修复方案,将响应时间从分钟级压缩至实时交互。金融研究机构Rogo的应用负责人Alex Wang评价称,使用该功能处理复杂问题时"如同与真人进行实时对话"。零售领域同样受益,系统能在用户浏览商品时即时提供库存查询、产品推荐等服务,有效降低购物车放弃率。
同期更新的ChatGPT桌面版新增Computer History功能,可自动记录用户的应用操作、窗口切换及文本输入等交互行为。与传统的Memories记忆功能不同,新系统无需用户主动告知信息,而是通过分析操作轨迹理解工作状态。例如用户询问"上次休息前在做什么"时,系统能直接调取相关操作记录进行回答。
数据隐私保护方面,OpenAI采取多项限制措施。交互事件文件仅在本地保留48小时,服务器处理后不存储原始数据,最终生成的记忆文件以Markdown格式保存在本地。用户可随时暂停数据收集,或排除特定应用/网站的数据采集。对于重复性工作流程,系统支持将其封装为可复用的技能模块,例如自动整理发布通稿的标准化步骤。
行业观察显示,推理速度已成为AI模型竞争的关键维度。Anthropic今年5月推出的Fast Mode将响应时间中位数从2.8秒压缩至1.2秒;Google的Gemini Flash Live专注实时交互场景;xAI则为Grok模型开设独立快速端点。芯片厂商的竞争更为激烈,Cerebras在中小模型领域实现每秒3000 token的生成速度,Groq以稳定低延迟见长,SambaNova则在高并发场景中展现优势。
国内市场同样加速布局,字节跳动豆包系列依托火山引擎推理基础设施,在延迟指标上保持领先;阿里Qwen-Turbo定位超快响应与长上下文处理,专为高并发场景设计;小米MiMo-V2.5-Pro-UltraSpeed通过算法优化,在8卡通用GPU上实现万亿参数模型每秒超1000 token的生成速度。月之暗面Kimi K3采用的KDA混合线性注意力架构,更将解码速度提升至常规架构的6.3倍。
