1 of 26

1

答辩人:卞耀亮

专业:微电子

导师:李鹏 教授 ,

Ameer Abdelhadi教授

答辩日期:2024年10月23日

深度强化学习的定制硬件

境外科研实践项目答辩

2 of 26

目录

  • 研究背景
  • 研究路线
  • 研究内容
    • 基于专用硬件的加速器
    • 高级计算范式
    • 强化学习中的加速技术
  • 总结与展望

2

3 of 26

目录

  • 研究背景
  • 研究路线
  • 研究内容
    • 基于专用硬件的加速器
    • 高级计算范式
    • 强化学习中的加速技术
  • 总结与展望

3

4 of 26

强化学习(RL)发展概况

4

机器人

自动驾驶

智慧医疗

游戏AI

5 of 26

持续增长的算力需求

5

6 of 26

通用计算架构VS领域专用架构(DSA)

6

领域专用架构的优势

通用计算架构的挑战

7 of 26

目录

  • 选题背景
  • 研究路线
  • 研究内容
    • 基于专用硬件的加速器
    • 高级计算范式
    • 强化学习中的加速技术
  • 总结与展望

7

8 of 26

研究路线

8

深度强化学习的定制硬件

基于专用硬件的加速器

  • 环境加速技术
  • 策略训练加速

高级计算范式

  • 高维计算
  • 脉冲神经网络

计算挑战

计算范式

计算速度

强化学习的加速技术

  • 量化

9 of 26

目录

  • 选题背景
  • 研究路线
  • 研究内容
    • 基于专用硬件的加速器
    • 高级计算范式
    • 强化学习中的加速技术
  • 总结与展望

9

10 of 26

研究内容一:基于专用硬件的加速器

10

CPU-GPU架构,通过利用并行处理能力,提供了一种可扩展且具有成本效益的RL加速解决方案。

环境加速技术

基于GPU的环境模拟可以克服基于CPU的仿真器的局限性。

CuLE(CUDA学习环境)

基于CPU的仿真器

41K~155K帧每秒(FPS)

12.5K~19.8K 帧每秒

可扩展性,四个GPU的吞吐量可达到187K FPS

扩展性差

WarpDrive

传统的基于CPU的实现

每秒290万个环境步骤

每秒几万个环境步骤

GPU加速的机器人模拟框架

传统基于CPU的方法

单个GPU训练人形跑步任务可以在20分钟内完成

20000分钟

11 of 26

策略训练加速

11

通过利用GPU固有的并行性和优化数据处理工作流来提升训练过程。

1.多GPU设置

通过在多个GPU之间分配计算工作负载来加速策略训练。一个统一的框架支持在多个GPU上同步和异步优化技术,来并行化策略梯度和Q值学习方法。通过采用同步采样和多GPU优化,这个框架将训练时间从几个小时缩短到几分钟。例如,策略梯度方法可以在8个GPU服务器上在10分钟内实现成功策略,展示了这种方法的可扩展性和效率。

GUNREAL

传统的基于CPU的RL框架

快3.8到9.5倍

GUNREAL

GA3C

训练效率提高了73%

2.将GPU优化架构与辅助学习任务相结合

12 of 26

策略训练加速

12

3.优化CPU和GPU资源之间的平衡

相对于 GPU 资源,增加基于 CPU 的仿真角色数量可以显著加速策略训练。最佳的 CPU/GPU 比例可以确保资源的高效利用,减少瓶颈并提高整体系统性能。建议的 CPU/GPU 比例至少为 1:1(每个 GPU 流多处理器对应一个 CPU 线程),以最大化性能和能效。

13 of 26

目录

  • 选题背景
  • 研究路线
  • 研究内容
    • 基于专用硬件的加速器
    • 高级计算范式
    • 信道跳频机制
  • 总结与展望

13

14 of 26

研究内容二:高级计算范式

14

1.高维计算

HDPG:基于超维策略的强化学习

15 of 26

研究内容二:高级计算范式

15

与基于 DNN 的传统 RL 方法相比,HDPG在 FPGA 平台上实现了 4.7 倍的性能提升和 5.3 倍的能效提高

16 of 26

高维计算的可扩展性问题

16

可重构硬件解决方案

CPU-FPGA平台上的HDQL加速

17 of 26

基于高维计算(HDC)的分布式Q-Learning平台

17

多个agent的分布式异构 CPU-FPGA 平台

18 of 26

脉冲神经网络(Spiking Neural Networks, SNNs)

18

硬件架构模拟神经过程,以优化学习算法的效率。�利用神经尖峰的时序进行计算,显著减少了功耗,与传统方法相比,能效提高了两个数量级

19 of 26

目录

  • 选题背景
  • 研究路线
  • 研究内容
    • 基于专用硬件的加速器
    • 高级计算范式
    • 强化学习中的加速技术
  • 总结与展望

19

20 of 26

量化

20

21 of 26

目录

  • 选题背景
  • 研究路线
  • 研究内容
    • 基于专用硬件的加速器
    • 高级计算范式
    • 强化学习中的加速技术
  • 总结与展望

21

22 of 26

未来研究方向

22

  • 神经处理单元(NPU)

神经处理单元 (NPU) 是专门为增强神经网络计算效率而设计的硬件加速器,特别是乘加运算 (MAC)。虽然 NPU 主要用于深度学习,但其架构也适用于涉及深度神经网络 (DNN) 的 RL 任务。NPU 可以显著提高能效并减少功耗,这对于在功率受限环境中部署 RL 应用至关重要。例如,RENO 芯片设计利用了 RRAM 和 PCM 等非易失性存储器,实现了高达 53.17 TOPS/W 的能效。�NPU 具备多个 MAC 单元,能够高效执行 DNN 计算。此能力可在 RL 任务中加速神经网络的训练和推理,从而减少延迟并提高吞吐量。此外,NPU 内的近似计算技术可以在保持可接受精度的同时提高计算速度,这种权衡对于需要快速决策的动态 RL 环境尤为有利。

23 of 26

未来研究方向

23

  • RL 的高级架构方法

RL 中的矢量处理器:并行性和内存处理

矢量处理器传统上优化用于数据并行操作,已展示了在加速机器学习和科学计算中的显著潜力。它们能够同时在多个数据点上执行相同的指令,这使其非常适合 RL 中可并行化的部分,例如神经网络更新和状态与动作的批处理。例如,神经网络的前向传播或多个状态的 Q 值计算可以由矢量处理器高效处理。�

24 of 26

未来研究方向

24

  • 堆叠存储立方体 (SMCs) 在 RL 中的应用

SMCs 结合了内存级并行性 (MLP),并利用内部的片上网络 (NoC) 以实现多个存储库和存储块之间的高速数据传输。通过利用 MLP,SMCs 能够处理 RL 任务中常见的不规则内存访问模式,这些任务中状态、动作和奖励值会在训练的不同阶段频繁更新。根据 Hadidi 等人的研究,HMC 的峰值带宽可达 60 GB/s,相较于传统的基于 DDR 的内存系统有显著提升,后者往往受限于带宽。�

25 of 26

已取得成果

25

Hazem Taha, Yaoliang Bian, Ameer Abdelhadi, “Custom Hardware for Deep Reinforcement Learning: Where We’re Heading”, 在投

校外导师答应在PhD申请时提供推荐信

26 of 26

26

请各位老师批评指正

答辩人:卞耀亮