智能AI
morning
何时进行沟通:多智能体强化学习中原则性门控的置信分布和 KL 散度
摘要
arXiv:2608.14559v1 Announce Type: new Abstract: Effective communication in multi-agent reinforcement learning requires agents to decide not only \textit{what} to communicate, but when? Existing approa...
and
when
belief
the
IC3Net
only
communicate
cite
variance
gating
2026-08-18
1 阅读
约2分钟阅读
Teoman Kaman
字号:
arXiv:2608.14559v1 公告类型:新 摘要:多智能体强化学习中的有效通信要求智能体不仅要决定 \textit{什么} 进行通信,还要决定何时进行通信?现有的方法要么在每个时间步进行通信,要么通过强化策略梯度来学习二元门\cite{singh2019},这是一种产生不稳定且无法解释的门控行为的高方差信号。我提出了一个有原则的替代方案:仅当代理学习到的信念分布之间的 KL 散度超过固定阈值时才进行通信。每个代理在潜在世界状态上维护一个信念分布,该信念分布计算为其 LSTM 隐藏状态上的 softmax,并且仅当信念分歧足够大以证明信息交换合理时才进行通信。我在 IC3Net \cite{singh2019} 的 Predator-Prey 基准测试上评估了这种方法,跨两个环境大小(每个环境大小有 5 个种子),并在 MPE simple\_spread \cite{lowe2017} 上与 IC3Net、CommNet 和独立控制器进行比较。在 PP 10$\times$10 上,IC3Net 在所有阈值上都优于 KL 信念。在较难的 PP 20$\times$20 上,$\varepsilon \in \{0.1, 0.3, 0.5, 1.0\}$ 上的阈值消融显示出倒 U 形:$\varepsilon=0.5$ 实现了 73.84 步平均步数和 42\% 成功率,而 IC3Net 的平均步数为 75.31 步和 31\%,差距为1.47 个步长和 11 个百分点,种子方差更小。在 MPE 上,即使门控处于非活动状态,信念头也将平均奖励提高了 12 个点,并将方差降低了 26$\times$,这表明了两个正交贡献:信念可以收敛时的原则性门控,以及无论如何都有利于协调的改进的潜在表示。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱