MCPO: Masked and Counterfactual Policy Optimization for Agentic Model Selection
给定一个用户请求与海量的候选模型仓库,MCPO 首次将智能体(Agent)的模型选择过程形式化为强化学习问题,训练一个紧凑的策略直接从结果反馈中学习,无需依赖昂贵的大模型推理即可在候选模型中挑选出最匹配的模型。
1. 概述
本文提出了 MCPO(Masked and Counterfactual Policy Optimization),一个面向智能体模型选择(agentic model selection)的强化学习框架。与现有方法把模型选择当作推理时的提示(prompting)问题不同,MCPO 首次将其建模为强化学习问题,训练一个紧凑的策略直接从结果反馈中学习,从而摆脱对冻结模型或模仿学习的依赖。
图 1: 多轮智能体模型选择的概览与每轮内的微观动作空间
2. 动机与解决的问题
在构建强大 AI 智能体的过程中,从持续演化的开源仓库(如 Hugging Face)中为数百万个专用模型挑选最合适者已成为关键瓶颈。现有方法(如 HuggingGPT 等)主要依赖推理时提示,其选择逻辑仍停留在冻结模型或模仿策略中,缺乏显式的结果反馈,无法根据”所选模型是否真正满足用户请求”进行优化。
将标准强化学习直接应用于此场景会面临三大失败模式:
- 身份记忆(identity memorization):巨大的、持续演化的候选模型池使得策略容易过拟合到模型名称本身。
- 流行度偏置(popularity-biased exploration):采样分布过度偏向早期、流行的候选,难以探索长尾中的稀有模型。
- 错失更优方案(missed superior alternatives):当更优模型出现在同一候选列表中时,策略缺乏信号去感知这一机会成本。
3. 核心方法
MCPO 通过三个互补机制将策略优化适配到仓库规模的模型选择场景:
动态身份掩码(Dynamic Identity Masking)
在 rollout 采样阶段,动态掩码模型身份,防止策略过拟合到模型名称。
逐轮轨迹剪枝(Round-wise Trajectory Pruning)
重新平衡 rollout 分布,将探索从早期、流行度偏置的候选扩展到后续轮次中更稀有的备选模型。
反事实优势估计(Counterfactual Advantage Estimation)
从 gold labels 直接计算优势,无需学习价值网络;当策略忽略了候选列表中的更优模型时,对其施加惩罚,从而将未选择候选的机会成本纳入策略梯度。
4. 创新性贡献
- 首次的 RL 形式化:首次将模型选择建模为强化学习问题,训练策略从结果反馈中优化选择质量,而非依赖冻结模型或模仿学习。
- 三大失败模式的系统刻画与解决:识别出标准 RL 应用于仓库规模智能体模型选择时的三种失败模式,并提出 MCPO,通过动态身份掩码、逐轮轨迹剪枝与反事实优势估计加以解决。
- 显著的效果与效率优势:在最大规模模型选择基准上,用 MCPO 训练的 Qwen3-8B 策略达到 84.25% 的综合得分,超过最强的免训练基线 5.21 分,并超越 GPT-5.4 等更大的闭源系统(79.04%),且推理成本远低于后者。
5. 总结
MCPO 通过动态身份掩码、逐轮轨迹剪枝与反事实优势估计,将强化学习适配到仓库规模的智能体模型选择,缓解了身份记忆、流行度偏置探索与错失更优方案三大问题。实验表明,其在小而专门的策略上即可实现领先的选择质量,为持续演化的模型仓库提供了一种可扩展、低成本且不断自我改进的模型选择范式。