{
  "id": "a4b2833f-6d96-4c6a-a6fd-50a186f74d62",
  "user_id": "b63a6fb4-bc1e-4876-b83e-4f83cc245967",
  "title": "2125103056 张帅 汇报",
  "filename": "2125103056 张帅 汇报.pptx",
  "file_path": "/lucky/baizorapp/backend/data/users/b63a6fb4-bc1e-4876-b83e-4f83cc245967/coursewares/a4b2833f-6d96-4c6a-a6fd-50a186f74d62.pptx",
  "slide_count": 14,
  "tags": [],
  "status": "active",
  "created_at": 1776743431,
  "updated_at": 1776743431,
  "slides": [
    {
      "slide_index": 0,
      "texts": [
        "计算机科学与技术学院 本科毕业设计中期检查\u000b\u000b基于强化学习的多智能体路径算法研究与实现",
        "答辩人：张帅 | 学号：2125103056\n指导老师：陈祖希\n计算机科学与技术学院\n2026年4月1日"
      ],
      "title": "计算机科学与技术学院 本科毕业设计中期检查\u000b\u000b基于强化学习的多智能体路径算法研究与实现"
    },
    {
      "slide_index": 1,
      "texts": [
        "目录",
        "一、研究背景和意义\n二、国内外研究现状\n三、研究工作和内容\n四、基于强化学习的多智能体路径算法研究与实现\n五、实验分析\n六、创新点总结和后续规划"
      ],
      "title": "目录"
    },
    {
      "slide_index": 2,
      "texts": [
        "随着人工智能和自动化技术的快速发展，多智能体系统(Multi-Agent System, MAS) 在无人机编队、自动驾驶、仓储物流、机器人协作等领域得到了广泛应用，同时这些场景的对多智能体路径规划(Multi-Agent Path Finding, MAPF) 的实时性、动态适应性和安全性提出了极高要求。\n传统MAPF方法(如基于搜索的A* 、CBS算法) 虽然在小规模环境中有效，但在大规模环境下由于状态空间和计算复杂度呈指数增长，导致效率低下且难以满足实时性需求\n相关研究成果可广泛应用于智能交通、无人机集群、智能仓储、机器人协作等实际场景，助力智慧城市、智能制造等领域的发展。通过提升多智能体系统的自主协作与决策能力，将为社会生产和生活带来更高的效率与安全性，推动人工智能技术的创新与落地。",
        "一、研究背景和意义",
        "图1 物流仓库的智能机器人"
      ],
      "title": "一、研究背景和意义"
    },
    {
      "slide_index": 3,
      "texts": [
        "二、国内外研究现状",
        "张克（2025）等人针对多出口的火灾隐患设计出了一种多智能体强化学习（MARL-HE）用于躲避危险过程中的路径寻觅，和比MAPPO相比该方法可将疏散时间步长缩短25.12%，并提高撤离成功率7.06%，从而在火灾紧急情况下实现更安全、更高效的疏散路径[1]。"
      ],
      "title": "二、国内外研究现状"
    },
    {
      "slide_index": 4,
      "texts": [
        "二、国内外研究现状",
        "G.F. Al Mustafid等人提出一种结合模糊迪杰斯特拉 (Fuzzy-Dijkstra) 方法的路径查找方案，该方法通过引入Fuzzy Sugeno将道路密度和路段长度作为每条路径的权重参数进而执行Dijkstra算法，以计算最短路径，并与与谷歌地图的最优距离相比，该系统的准确率为86.72%[2]。\nA.Singh等人通过探讨各种超参数和路径探索策略对MADDPG性能的影响，并提出对MAD-DPG的改进方案，研究结果表明，MAD-DPG在单智能体策略梯度方法中表现显著优于其他方法并对MAD-DPG的创新改进有效解决了其主要局限，使算法能够更高效地扩展以容纳更多智能体，同时对整体性能的影响极小[3]"
      ],
      "title": "二、国内外研究现状"
    },
    {
      "slide_index": 5,
      "texts": [
        "三、研究工作和内容",
        "研究的主要内容：\n搭建MPE环境，实现智能体在复杂环境下的状态观测、动作选择、环境交互和奖励反馈，为算法训练与评估提供基础支撑。\n设计并实现MAPPO-CMA框架。\n循环神经网络模拟启发式进化路径\n镜像法改良（针对连续动作空间）修正残差的影响"
      ],
      "title": "三、研究工作和内容"
    },
    {
      "slide_index": 6,
      "texts": [
        "四、基于强化学习的多智能体路径算法研究与实现"
      ],
      "title": "四、基于强化学习的多智能体路径算法研究与实现"
    },
    {
      "slide_index": 7,
      "texts": [
        "MAPPO-CMA以集中式训练分布式执行（CTDE）的演员-评论家（Actor-Critic）框架为基础，融合循环神经网络（RNN）与协方差矩阵适应策略的思想，核心改进包括：",
        "4.1 MAPPO-CMA框架设计",
        "网络结构：在Actor网络（策略输出）与Critic网络（价值评估）中引入RNN，保留历史样本的赋权影响（模拟启发式进化路径）；\n输入设计：Actor网络输入智能体局部观测与前一轮动作，Critic网络输入全局观测与前一轮动作概率分布；\n损失函数：结合PPO的clip损失与镜像法改良的损失，平衡稳定性与探索度。"
      ],
      "title": "MAPPO-CMA以集中式训练分布式执行（CTDE）的演员-评论家（Actor-Critic）框架为基础，融合循环神经网络（RNN）与协方差矩阵适应策略的思想，核心改进包括："
    },
    {
      "slide_index": 8,
      "texts": [
        "4 .2框架结构",
        "Actor 网络负责输出单个智能体的动作概率分布，供智能体在环境中“选动作”（分布式执行阶段）。\nActor网络输入各智能体自己的观测以及上一轮选取的动作，输出本轮动作的概率分布；",
        "Actor网络",
        "Critic网络",
        "Critic网络输入全局观测以及上一轮动作的概率分布，输出状态值以及优势值。其中全局观测由各个智能体的局部观测联结得出。 \n\n网络结构：\n第一层 MLP：对全局观测和历史信息进行特征提取。\nRNN模块：结合全局特征，建模“全局状态演化 + 策略历史”的长期价值影响。\n第二层 MLP：输出价值相关指标"
      ],
      "title": "4 .2框架结构"
    },
    {
      "slide_index": 9,
      "texts": [
        "五、实验分析"
      ],
      "title": "五、实验分析"
    },
    {
      "slide_index": 10,
      "texts": [
        "5.1 对比算法与模型训练"
      ],
      "title": "5.1 对比算法与模型训练"
    },
    {
      "slide_index": 11,
      "texts": [
        "6 创新点总结与后续规划",
        "后续规划：\n完善MAPPO-CMA框架代码\n后学对比多种MAPF方法并进行可视化\n撰写论文",
        "创新点总结：\n针对多智能体近端策略优化算法进行改进解决该算法在复杂多智能体环境存在的过拟合等问题"
      ],
      "title": "6 创新点总结与后续规划"
    },
    {
      "slide_index": 12,
      "texts": [
        "[1].K. Zhang, D. Zhu, X. Zhao, S. Cherry, Y. Fujisawa and T. Sugawara, \"MARL-HE: An Improved Multi-agent Reinforcement Learning-based Pathfinding Method for Fire Evacuation Guidance,\" 2025 International Joint Conference on Neural Networks (IJCNN), Rome, Italy, 2025, pp. 1-8, doi: 10.1109/IJCNN64981.2025.11229006.\n[2] .G. F. Al Mustafid, P. Kristalina and I. G. P. Astawa,\"Towards Shortest Path Finding System Using Fuzzy-Dijkstra Method for Emergency Routing Problem,\"2022 International Electronics Symposium (IES), Surabaya, Indonesia, 2022, pp. 236-241, doi: 10.1109/IES55876.2022.9888373.. \n[3]. A. Singh, D. Dixit and A. Verma, \"Scaling MADDPG for Enhanced Multi-Agent Reinforcement Learning,\" 2025 Second International Conference on Pioneering Developments in Computer Science & Digital Technologies (IC2SDT), Delhi, India, 2025, pp. 118-123, doi: 10.1109/IC2SDT68218.2025.11383636..",
        "参考文献"
      ],
      "title": "参考文献"
    },
    {
      "slide_index": 13,
      "texts": [
        "Thanks!",
        "张帅\n2026年4月1日"
      ],
      "title": "Thanks!"
    }
  ]
}