设计应用

VG-ADP:基于价值引导与扩散对抗的模仿学习方法

作者:唐坤1,王东升1,韩兴豪2,薄其乐1,王黎铭1,潘舒1
发布日期:2026-09-28
来源:集成电路应用

引言

面对具有严重次优性、复杂噪声以及策略不一致的多源轨迹数据,传统的多智能体行为克隆方法难以有效提取高回报的协同动作区域,极易收敛至无任务解决能力的次优解或导致策略彻底失效。相比之下,基于扩散生成与对抗机制的模仿学习方法,凭借其对复杂联合数据分布的高阶匹配与多峰拟合能力,成为处理该类问题的理想范式。然而,现有生成类方法在多智能体高动态场景中,往往受限于探索的盲目性与训练的不稳定性,难以直接生成高精度的协同动作。


本文详细内容请下载:

http://www.chinaaet.com/resource/share/2000007265


投稿邮箱:ICAPP@belling.com.cn


作者信息:

唐坤1,王东升1,韩兴豪2,薄其乐1,王黎铭1,潘舒1

(1.江苏科技大学计算机学院,江苏镇江212000;

2.江苏自动化所,江苏连云港222006)

此内容为AET网站原创,未经授权禁止转载。
扩散模型 对抗模仿学习 价值引导 集成电路应用