LLM强化学习新框架!UCSD多智能体训练框架让LLM工具调用能力暴增
大语言模型智能体的强化学习框架, 首次实现了通用的多智能体的“群体强化”。
在大语言模型(LLM)智能体的各种任务中,已有大量研究表明在各领域下的多智能体工作流在未经训练的情况下就能相对单智能体有显著提升。
但是现有的LLM智能体训练框架都是针对单智能体的,多智能体的“群体强化”仍是一个亟须解决的问题。
为了解决这一领域的研究痛点,来自UCSD和英特尔的研究人员,提出了新的提出通用化多智能体强化学习框架——PettingLLMs。支持任意组合的多个LLM一起训练。
研究背景
大语言模型驱动的多智能体系统在医疗、编程、科研、具身智能等多个领域均能大幅度提升任务表现。
为训练大模型智能体,Group Relative Policy Optimization (GRPO) 已被验证为通用的有效强化学习算法。然而,当前所有针对LLM的强化学习训练框架,包括GRPO算法本身,都局限于单智能体训练的范畴。多智能体间的协作优化,即“群体强化”的学习机制,仍然是一个亟待填补的空白。
GRPO算法的核心机制是,针对同一个输入(prompt),通过多次采样生成一组候选回答。随后,算法在组内对这些回答进行评估(例如,通过一个奖励模型),并计算它们之间的相对优势。
这种优势计算的有效性与公平性依赖于一个关键假设——组内所有用于比较的候选回答,都必须基于一个完全相同的上下文(即prompt)生成。
然而,将GRPO直接应用于多智能体(multi-agent)多轮(multi-turn)环境中存在一个核心困难。
在多智能体场景下,即使是针对同一个初始问题,不同智能体在不同轮次接收到的prompt差异显著。
例如(如图所示),一个负责编程的智能体,其在第二轮的prompt不仅包含原始问题,还可能融合了第一轮中自己生成的代码以及其他智能体生成的单元测试。
特别声明:以上内容(如有图片或视频亦包括在内)为“我要久久发用户上传并发布”,本平台仅提供信息存储服务。
热门文章
- 1000个官方媒体网站发布广告,每天百万人次曝光,帮您客户覆盖全国,业绩翻倍!
- 家中风水揭秘:挣扎者家中常见的11大问题
- 很多年轻人偏爱的 “树景房”,太美了...
- 积家装饰顶墙门柜同色设计让餐厨成为风景
- 救命!“无印良品”这几款真的巨巨巨好用,爱不释手啊!!
- 王力入户门怎么样?隔音效果好,多年使用无异响
- 王力入户门怎么样:自动上锁让孩子归家更安全
- 90后姑娘,全款拿下128㎡三室,满室收纳+多功能设计,高级感拉满
- 国内卫浴十大品牌良心推 :华艺卫浴适配现代风装修不踩雷
- 5种智能马桶不要买,买回家反而更难用,上厕所都成了一种痛苦!
- 石景山近期二手房走势如何?100个小区房价是啥情况?看看您家是涨是跌!
- 全网最听劝妈妈1分钟视频报价3万
- 为什么理发店洗完头能好几天不油
- 央行报告:2025年人均存款约11.8万
- 央视曝光“串珠兼职”骗局
- 短剧之后漫剧火了
- 电动车停满人行道 把人逼到路上
- 误购火车票可以限时免费退票了
- 贵州的教育方式多少有点说法
- 12306:“静音车厢”列车数量增加