Jul 2026
Multi‐Agent Reinforcement Learning for Concurrent Task‐Chain Scheduling in Heterogeneous Edge–Cloud Environments
DC‐MAPPO is developed, which introduces a Directional Clamp mechanism to improve policy update stability under high‐concurrency conditions and a dynamic action masking strategy is designed to ensure decision feasibility and reduce invalid exploration.
Xinyi Li, Chao Wang, Jiakai Liang et al.
· Concurrency and Computation · 0 citations