推荐系统优化新思路:AI“分权协作”让模型自主迭代升级
在推荐系统优化领域,工程师们长期面临一个难题:如何在庞大的改进空间中高效找到最优解。传统方法依赖人工经验反复试错,每次调整网络结构、损失函数或学习率都需要经历完整的训练和验证流程,耗时数小时甚至数天。随着大语言模型(LLM)的兴起,自动化机器学习工程(MLE Agent)成为新方向,这类系统试图让AI自主完成从代码修改到实验验证的全流程,但实际应用中却遭遇了效率瓶颈。
推荐系统的优化维度远超常规机器学习任务。以序列推荐为例,模型设计需同时考虑骨干网络架构、训练目标定义、正则化策略选择、特征交互方式以及序列建模机制等数十个决策点。若完全放任LLM自由探索,实验成本将呈指数级增长。研究显示,在开放式的工程决策空间中,随机尝试的成功率不足5%,这意味着绝大多数实验资源被浪费在无效方向上。
针对这一困境,研究团队提出分层优化框架RecHarness,其核心创新在于将决策过程拆解为"方向选择"与"方案生成"两个独立模块。该框架通过人类专家预设的"优化上下文"划定边界,再由赌博机路由器(Bandit Router)根据历史实验数据动态分配资源,最后由LLM在选定方向内生成具体代码。这种设计既保留了AI的创造性,又通过统计机制约束了探索范围。
赌博机路由器的运作机制借鉴了多臂老虎机问题的解决方案。系统将每个修改方向(如调整学习率、更换损失函数)视为独立的老虎机,根据历史验证结果动态调整资源分配比例。当某个方向连续产生正向收益时,系统会增加其探索权重;当提升趋于饱和时,则自动解锁更激进的"跳跃臂"选项。这种机制确保了80%以上的实验资源被投入到高潜力方向,相比随机探索效率提升近3倍。
在方案生成环节,RecHarness引入了实验技能文档(Experiment Skill)机制。该文档实时记录所有成功与失败的尝试,包括具体修改内容、效果变化趋势及错误日志分析。LLM在生成新方案前会先参考这份文档,避免重复踩坑。例如在短视频广告排序系统的优化中,系统通过分析历史失败记录,准确诊断出"序列内部关系建模缺失"的根本问题,进而设计出自注意力机制压缩方案,最终实现广告主价值2.08%的提升。
实证研究表明,该框架在亚马逊评论数据集上表现突出。对于基础较弱的GRU4Rec模型,命中率指标提升达86%;即便是性能优异的HSTU模型,仍能实现12%的优化空间。在快手KuaiRec数据集的测试中,系统对弱模型TPM的误差指标降低超过26%,对强模型GR的四个评估指标均产生正向影响。这些成果均在12小时的GPU计算时间内达成,验证了框架的高效性。
真实业务场景的部署进一步证明了框架的实用性。在某短视频平台的广告排序系统中,RecHarness自主发现的序列编码器改进方案,通过7天线上A/B测试,在仅10%流量的情况下实现收入0.53%的增长。更关键的是,该方案从问题诊断到代码生成完全由AI完成,展示了自动化工程优化的商业价值。
该研究的深层启示在于,在复杂系统优化中,简单的"AI接管一切"并非最优解。通过将统计决策机制与生成式AI结合,既发挥了人类专家的领域知识优势,又利用了LLM的上下文理解能力。实验技能文档的设计尤其值得关注,它使AI具备了从失败中提炼规律的能力,这种工程直觉的模拟可能成为下一代自动化系统的核心竞争力。
