Flash模型重塑行业规则:高能低价成主流,大模型竞争开启新篇章
近日,大模型领域迎来新一轮竞争热潮,智谱与阿里先后发布新款Flash模型,引发行业关注。这两款模型不仅在性能上表现亮眼,更以极具竞争力的价格策略,重新定义了Flash模型的市场定位。
智谱此次推出的GLM-5.3 Flash,此前以Ox-Alpha的代号在大模型聚合平台进行匿名测试,一周内吸引超50万独立用户,累计消耗Token达44T,完成超1300万个会话。该模型拥有百万上下文窗口,支持原生多模态功能,包括图片、视频、文件处理及编程能力。在定价方面,GLM-5.3 Flash展现出极大诚意,限时折扣期内每百万Token输入仅需0.4元,输出1.4元,缓存命中0.115元,价格仅为GLM-5.3的二十分之一。
阿里同步发布的Qwen3.8-Flash同样引人注目。作为Qwen4架构的早期预览版,该模型采用下一代架构设计,在保留百万上下文窗口和图像视频输入能力的同时,将生成速度提升100%,Token消耗减少75%。其定价策略同样激进,每百万Token输入1元、输出3元,仅为Qwen3.8-Max的十二分之一。这种定价策略使得两款模型在性价比方面形成显著优势,甚至低于当前市场上的DeepSeek V4 Flash。
技术层面,这两款Flash模型展现出突破性进展。GLM-5.3 Flash在智谱的Coding Agent平台ZCode上可直接体验,其多模态视觉能力令人印象深刻。测试中,该模型成功解析视频内容,将像素块组成的树转换为可扫描的二维码,尽管初始版本存在卡顿问题,但经过优化后实现流畅运行。整个项目从视频解析到3D网页生成,消耗近3000万Token,显示出强大的处理能力。
Qwen3.8-Flash则在架构创新上表现突出。该模型主参数达1250亿,但通过高效激活机制,每token仅激活60亿参数。其原生支持26.2万token上下文,并可通过技术扩展至百万级别。特别值得注意的是,通过架构优化,其训练成本降至前代的九分之一,同时在编码和办公任务上表现更佳。这种设计思路代表了大模型发展的新方向——在保持高性能的同时,通过技术创新降低成本。
市场表现方面,GLM-5.3 Flash的匿名测试已取得显著成效,成功终结DeepSeek在OpenCode平台56天的霸榜纪录。智谱透露,该模型的推理服务全部由国产芯片提供支持,调用超过10万张国产芯片构建的集群,在硬件效率和单位token成本上已达到与主流英伟达GPU相当的水平。这标志着国产芯片在大模型应用领域取得重要突破。
行业分析指出,Flash模型正在经历从"减配降价"到"高性能低成本"的战略转型。过去,Flash模型通过削减上下文长度、剥离多模态能力等方式降低成本;现在,厂商们选择保持功能完整性,通过优化架构和激活参数来压缩成本。这种转变使得Flash模型能够承担更复杂的任务,如全天候AI代理、文档格式转换等日常工作流。
竞争格局方面,Google的模型发布策略提供了有趣参照。自今年2月发布Gemini 3.1 Pro后,Google连续推出多个Flash版本模型,显示出对这一细分市场的重视。当前,大模型厂商的竞争焦点已从单纯的性能比拼,转向"任务完成率×成本"的综合效率较量。在这种背景下,能够提供足够智能且成本可控的模型,将占据市场主动权。
实际应用测试显示,GLM-5.3 Flash与旗舰版本GLM-5.3的体验差距远小于价格差距。在常规网页开发和研究报告等任务中,两者表现接近,但GLM-5.3 Flash的成本优势明显。这种特性使其特别适合需要长时间运行的后台任务,用户无需担心高额费用即可持续使用AI服务。
