LLM强化学习新框架!UCSD多智能体训练框架让LLM工具调用能力暴增
大语言模型智能体的强化学习框架, 首次实现了通用的多智能体的“群体强化”。
在大语言模型(LLM)智能体的各种任务中,已有大量研究表明在各领域下的多智能体工作流在未经训练的情况下就能相对单智能体有显著提升。
但是现有的LLM智能体训练框架都是针对单智能体的,多智能体的“群体强化”仍是一个亟须解决的问题。
为了解决这一领域的研究痛点,来自UCSD和英特尔的研究人员,提出了新的提出通用化多智能体强化学习框架——PettingLLMs。支持任意组合的多个LLM一起训练。
研究背景
大语言模型驱动的多智能体系统在医疗、编程、科研、具身智能等多个领域均能大幅度提升任务表现。
为训练大模型智能体,Group Relative Policy Optimization (GRPO) 已被验证为通用的有效强化学习算法。然而,当前所有针对LLM的强化学习训练框架,包括GRPO算法本身,都局限于单智能体训练的范畴。多智能体间的协作优化,即“群体强化”的学习机制,仍然是一个亟待填补的空白。
GRPO算法的核心机制是,针对同一个输入(prompt),通过多次采样生成一组候选回答。随后,算法在组内对这些回答进行评估(例如,通过一个奖励模型),并计算它们之间的相对优势。
这种优势计算的有效性与公平性依赖于一个关键假设——组内所有用于比较的候选回答,都必须基于一个完全相同的上下文(即prompt)生成。
然而,将GRPO直接应用于多智能体(multi-agent)多轮(multi-turn)环境中存在一个核心困难。
在多智能体场景下,即使是针对同一个初始问题,不同智能体在不同轮次接收到的prompt差异显著。
例如(如图所示),一个负责编程的智能体,其在第二轮的prompt不仅包含原始问题,还可能融合了第一轮中自己生成的代码以及其他智能体生成的单元测试。
特别声明:以上内容(如有图片或视频亦包括在内)为“我要久久发用户上传并发布”,本平台仅提供信息存储服务。
热门文章
- 1024程序员节京东开放“零帧起手”数字人技术
- 内置24000转/分钟风扇!红魔11 Pro图赏
- W47单品销量,小米17 Pro Max真牛,同档国产全没上榜
- 红魔11 Air证件照公布:骁龙8至尊版、7000mAh电池
- 贝尔金发布70W氮化镓三口快充头,售316元
- 英特尔Nova Lake曝光:旗舰52核怪兽,性能核IPC涨15%
- 一张图看懂智驾"安全公开课"嘉宾精彩观点
- 灵隐寺免门票首日入园名额已约满
- 黄河壶口瀑布现“彩虹横卧”景观
- 两个“1980” 苏翊鸣强势夺金
- 男子花1年定制2米高可通话摩托罗拉
- 长沙连续17年获中国最具幸福感城市
- 刘强东:未来机器人会完成所有工作
- 300元滑雪服被冻哭的年轻人焊身上了
- 退休老人不抢鸡蛋抢起了船票
- 大脑“断崖式衰老”的3个年龄
- 老君山景区拒绝用无人机取代挑山工
- 解读智己LS9,标配520线激光雷达+Thor芯片,究竟有啥不同?
- 联想提出RNL技术,通过多维感知等解决AI训练中的难题
- 曝特斯拉曾拆解多款中国电动汽车