COBRA‑Skills:基于上下文赌博机引导进化的智能体技能优化框架原文网页:https://arxiv.org/html/2609.11682v1摘要大语言模型智能体可以利用从历史任务经验中蒸馏得到的可复用技能提升性能。但现有的技能优化方法往往开销巨大,需要大量基于执行的评估与海量任务样本。本文提出COBRA‑Skills高效框架:将技能优化建模为在动态演化候选空间上带预算约束的序列优化问题。COBRA‑Skills结合上下文赌博机优先排序与证据驱动的技能进化,选择性地把评估资源分配给高潜力、高信息增益的候选技能,同时利用执行反馈持续迭代优化技能种群。在6个异构智能体基准、3个目标大模型上开展实验:对比SkillOpt基线,COBRA‑Skills优化开销降低55‑58%;每个基准仅使用50条独立优化样本即可取得最优平均性能。额外实验表明,该框架在不同智能体执行脚手架下具备鲁棒性;也支持直接使用目标模型自身完成技能生成与迭代(自教学模式)。关键词大模型智能体、智能体技能、上下文多臂赌博机、技能进化、样本高效优化目录引言相关工作方法3.1 问题定义3.2 COBRA‑Skills整体流程3.3 上下文赌博机:候选技能优先排序3.4 证据驱动进化算子3.4.1 再生算子 Regeneration3.4.2 轨迹变异算子 Rollout (\mathcal{M})utation3.4.3 交叉算子 Crossover实验4.1 实验配置4.1.1 评测基准4.1.2 模型设置4.1.3 对比基线4.1.4 实现与评测协议4.2 主要实验结果4.2.1 整体性能4.2.2 优化开销与样本效率4.2.3 跨智能体脚手架泛化4.2.4 优化动态过程消融实验5.1 赌博机模块、进化模块有效性5.2 对教学模型的依赖(自教学模式)5.3 跨模型技能迁移5.4 探索‑利用权衡超参数(\nu)敏感性相关工作6.1 智能体技能与技能优化6.2 用于自适应优化的赌博机算法结论参考文献附录A 实验完整配置A.1 COBRA‑Skills超参数完整配置A.2 基线实现细节A.3 各个基准数据集细节附录B 补充实验结果B.1 优化开销计算B.2 自教学模式完整结果B.3 多checkpoint中间结果附录C Prompt模板脚本C.1 再生算子PromptC.2 轨迹变异算子PromptC.3 交叉算子Prompt1 引言智能体技能(Agent Skill)是从历史任务经验中蒸馏出的可复用过程化知识;以文本SKILL.md形式注入智能体系统提示,改变大模型推理行为。现有工作Trace2Skill、SkillOpt依靠大量轨迹样本、频繁执行评估迭代进化技能,存在两大痛点:评估开销昂贵:每一条候选技能都需要在大量任务样本上执行智能体,token与API成本很高;样本需求量大:需要大量训练样本,资源受限场景难以落地。本文提出COBRA‑Skills,核心思路:将技能优化建模为带预算约束的上下文赌博机序列决策问题;把每一条候选技能当作赌博机臂,技能语义Embedding作为上下文特征;结合神经网络奖励预测器+LinearUCB置信上界,平衡探索‑利用,优先评估高潜力、高不确定的候选,减少无效评估;设计证据驱动的进化算子:再生、轨迹变异、交叉,周期性更新技能种群;全部进化修改基于真实执行轨迹证据,避免无依据空想。本文贡献将智能体技能优化建模为预算受限、动态候选空间下的上下文赌博机序列优化问题;实现COBRA‑Skills框架:上下文赌博机优先排序 + 证据驱动技能进化算子;在6个异构智能体基准、3个目标模型完成评测,相比SkillOpt,开销降低55‑58%,仅用每个基准50条优化样本取得更优性能;消融验证各模块作用;验证自教学模式、跨脚手架、跨模型技能迁移能力;公开代码仓库。2 相关工作2.1 智能体技能与技能优化智能体技能将可复用流程、启发式规则封装为文本,注入系统提示,无需微调模型参数。Trace2Skill:从失败/成功轨迹蒸馏技能;SkillOpt:迭代反射编辑、进化优化技能;CoEvoSkills、(\mathcal{M})eta‑Skills:协同进化、记忆库等方案。现有方法大多不做评估资源分配,对全部候选无差别执行评估,开销高。COBRA‑Skills重点解决评估资源预算约束,使用上下文赌博机做候选筛选。2.2 赌博机算法用于自适应优化上下文多臂赌博机(Contextual Bandit),臂带有上下文特征,平衡探索‑利用,广泛用于Prompt优化、超参数调优。COBRA‑Skills将技能Embedding作为上下文特征;不仅用于选择待评估候选,还利用得分做种群修剪,和证据进化算子闭环联动。3 方法3.1 问题定义目标模型KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{M}\)};任务分布KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{D}\)};优化集KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{D}\)}_…:小规模带预算样本集合;测试集KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{D}\)}_…用于泛化评估;技能s ss:文本SKILL.md,注入系统提示改变KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{M}\)}行为;优化目标:从有限预算中,得到技能s ∗ s^*