刚发布就火遍海外!阿里Qwen3.8单文件手搓「星系碰撞」
今日,阿里正式发布新一代基座大模型Qwen3.8,总参数量2.4万亿,在编程和专业办公方面能力大幅提升,
并将首次开源Max级模型
。
Arena最新榜单显示,
阿里Qwen模型仅次于Anthropic的Claude系列
,整体性能处于全球大模型第一梯队。

这是千问首次将总参数量拓展至
2.4T,激活95B,获得了更高的推理效率、更快的推理速度,
整体性能也迎来新突破。它支持视觉理解,上下文长度达1M Tokens。
官方发布了基准测试结果。
在科研复现评测
PaperBench等编程智能体评测中,Qwen3.8-Max较上代模型大幅提升28.2分,以93.0分录得评测新高;

在
WideSearch
、Agent's Last Exam等通用智能体评测中,新模型分别取得81.9分和52.4分,位居前沿。
发布不到一天,
千问
3.8
便在海外开发者社区引发密集讨论,
X
平台上关于
Qwen
的搜索量快速攀升。
实测表现
实现16天自主编程
官网给出一个实测案例。
在无需人工干预情况下,
Qwen3.8-Max
自主编程完整交付一个
Hermes
级别的自进化智能体系统。

只需一句
“
创建一个自进化的智能体
Harness”
,
Qwen3.8
就像个资深的工程师,从零开始,自主搭建循环工程(
Loop Engineering
)框架,
编排智能体自动领取和执行任务,人类工程师还可通过钉钉给
Qwen3.8
提出新要求。
Qwen3.8
独立编程运行
约
16
天后,做出了一个
Hermes Agent
级别的、真实可用的自进化智能体框架
“oh-my-cli”
,目前该项目现已完全开源,完整过程公开保存在
GitHub
仓库里,可供所有人查看。
让海外社区
非常
惊艳的,
是一个由开发者用
Qwen3.8
单文件手搓出来的「星系碰撞」
N-body
模拟
。
在没有任何第三方引擎、只用一个
HTML
文件的前提下,
Qwen3.8
生成的程序同时渲染出
6000
多个粒子、两个相互旋转的旋涡星系,并在碰撞过程中拉扯出真实的潮汐尾结构。更关键的是,它背后跑的是真正的引力物理演算,而非贴图动画
——
粒子之间按引力规律相互吸引、加速、被甩出,星系逐渐并合。
程序还自带拖拽、缩放、播放控制,以及一块实时刷新的中文数据面板,把粒子数、时间步长等参数直接呈现出来。一个文件、一次生成,就跑出了接近专业天体物理可视化的效果,海外开发者纷纷转发,认为这种
"
从零到可交互
"
的整体完成度,正是
Qwen3.8
生成能力的直观证明。

在Coding能力方面,
AI普瑞斯用同一套提示词,测试了下Qwen3.8和另一家最近比较火的大模型,再通过
Codex
,用GPT的5.6 sol做对比:


Qwen 项目最大的优点是“更懂产品要求”。它实现了真正的逐步骤重新生成,每个结果区右上角都有重新生成按钮,明显比另外一家大模型只能整套重跑更符合“支持重新生成”的产品语义。

专业工作任务测试
一个金融研究团队基于数年的专业知识积累,搜集资本市场全面、实时的变动,才能依次完成的量化策略研究,
Qwen3.8
自主调动并行的智能体,
连续工作数小时后交付完整的
ETF
轮动策略,并持续分析回测、动态修正、最后实现规模化盈利。
AI普瑞斯测为了测试其金融分析功能,
一组直接下达指令让
Qwen3.8-Max
分析Meta财报,另一组同步上传Meta财报原始文件交由模型解析,对比两种方式输出结果的差异。
结果显示,基于现有文件的分析更详细全面,维度更完整。没有提供文件支持时,
模型依靠全网检索完成分析,核心数据准确,关键信息均覆盖,整体论述同样具备充足深度。
当然,测试并非一边倒。也有
海外
开发者指出,
Qwen3.8
在着色器渲染测试中的表现
还有优化空间
,在个别达人自建的
3D
坐标测试里得分
不及
GPT-5.6
和
GPT-5.5 xhigh
,显示其在特定图形与空间任务上仍有提升空间。
相比性能本身,海外社区更期待的是
Qwen3.8
的开源动作。
Qwen3.8-27B
即将开源
的消息一经放出便引爆讨论,多位大
V
对即将开放的权重表达期待,有开发者预测
Qwen3.8-27B
有望成为单卡消费级
GPU
部署的
"
新王者
"
,
毕竟
千问
上一代
开源的小模型还是
几个月前
的
Qwen2.5系列。
多模态能力
Qwen3.8-Max除了拥有强大的文本和推理能力,还提高了AI
视觉理解能力的极限
。
直接给
Qwen3.8-Max
民法典文件,整整206页文件,让它摘取重点。
给
Qwen3.8-Max
一段近20分钟的新闻视频,它对于视频内容总结详细,梳理清晰,具体数据也没有出错,20分钟的内容3分钟可以全部读完。
此外,
Qwen3.8-Max在长程能力也有很大提升。可以自主演进芯片设计,持续迭代、优化。

目前,Qwen3.8的API已上线千问AI平台,并接入阿里今日同步推出的Agent产品“千问办公”。Qwen3.8-Max预计下周开源,同时还将开源 Qwen3.8-27B。
价格上,国内每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元,而输入与输出的国际价格仅为Opus5的40%与24%,实现相近智能更高性价比。
据了解,
阿里真武
M890超节点也已成功适配Qwen3.8,
通过芯片、云平台与千问大模型的全链路优化,显著提升推理效率、降低推理成本,在Agentic推理场景中最多可实现1.5倍性能提升。(转载自AI普瑞斯)
