新型大模型压缩方法实现AI高效“瘦身”
本报讯(见习记者赵婉婷)中国科学院理论物理研究所研究员苏刚团队联合首都师范大学教授冉仕举课题组,将量子物理张量网络思想引入大模型压缩,提出Tensor Mixture(MixT)张量混合压缩框架,在精简参数的同时,同步削减算力、显存与能耗。研究论文近日在预印本平台arXiv公布,相关技术已获得国家发明专利。
近年来,人工智能大模型发展迅速,但动辄千亿级参数带来的高昂训练与部署成本,只有少数大型科技公司能够负担,普通科研机构、企业乃至个人开发者都面临着极高门槛。
剪枝、量化、低秩分解等主流大模型压缩方式通过降低权重精度、引入稀疏结构等降低资源开销,其效益取决于算法实现、计算内核和硬件支持。MixT则是将变换器模块中的标准稠密线性映射重构为可直接执行的张量算子混合体,而非仅仅将张量作为压缩参数的手段。“MixT全程保留张量运算架构,既能压缩参数量,又能同步削减计算开销与显存占用。”苏刚说。
研究团队在LLaMA2-7B模型上测试了MixT的压缩能力。结果表明,在最佳压缩位置,MixT使得模型总参数减少47.5%、推理计算量降低37.1%、训练计算量降低52.1%、推理显存降低60.4%,同时在大规模多任务语言理解基准测试中综合能力几乎保持不变。“这意味着用同样的GPU,可以运行更大的模型;或者用更便宜的GPU,也能运行原本只有高端服务器才能运行的大模型。”苏刚说。
该研究还揭示出大模型具有“临界点”。研究人员逐步提高压缩程度时观察到一个有趣的现象:在压缩幅度到达阈值前,模型体量不断缩小,性能几乎不会衰减。然而,当压缩超过某一临界位置后,模型能力会骤然下降,如同物理中的“相变”。该现象揭示,大模型会在压缩“临界点”突然失去智能,说明大模型并非参数量越大性能越强,而是存在一个能够保持智能的最低结构复杂度。
相关论文信息:https://doi.org/10.48550/arXiv.2605.25344
