1
答辩人:卞耀亮
专业:微电子
导师:李鹏 教授 ,
Ameer Abdelhadi教授
答辩日期:2024年10月23日
深度强化学习的定制硬件
境外科研实践项目答辩
目录
2
目录
3
强化学习(RL)发展概况
4
机器人
自动驾驶
智慧医疗
游戏AI
持续增长的算力需求
5
通用计算架构VS领域专用架构(DSA)
6
领域专用架构的优势
通用计算架构的挑战
目录
7
研究路线
8
深度强化学习的定制硬件
基于专用硬件的加速器
高级计算范式
计算挑战
计算范式
计算速度
强化学习的加速技术
目录
9
研究内容一:基于专用硬件的加速器
10
CPU-GPU架构,通过利用并行处理能力,提供了一种可扩展且具有成本效益的RL加速解决方案。
环境加速技术
基于GPU的环境模拟可以克服基于CPU的仿真器的局限性。
CuLE(CUDA学习环境) | 基于CPU的仿真器 |
41K~155K帧每秒(FPS) | 12.5K~19.8K 帧每秒 |
可扩展性,四个GPU的吞吐量可达到187K FPS | 扩展性差 |
WarpDrive | 传统的基于CPU的实现 |
每秒290万个环境步骤 | 每秒几万个环境步骤 |
GPU加速的机器人模拟框架 | 传统基于CPU的方法 |
单个GPU训练人形跑步任务可以在20分钟内完成 | 20000分钟 |
策略训练加速
11
通过利用GPU固有的并行性和优化数据处理工作流来提升训练过程。
1.多GPU设置
通过在多个GPU之间分配计算工作负载来加速策略训练。一个统一的框架支持在多个GPU上同步和异步优化技术,来并行化策略梯度和Q值学习方法。通过采用同步采样和多GPU优化,这个框架将训练时间从几个小时缩短到几分钟。例如,策略梯度方法可以在8个GPU服务器上在10分钟内实现成功策略,展示了这种方法的可扩展性和效率。
GUNREAL | 传统的基于CPU的RL框架 | 快3.8到9.5倍 |
GUNREAL | GA3C | 训练效率提高了73% |
2.将GPU优化架构与辅助学习任务相结合
策略训练加速
12
3.优化CPU和GPU资源之间的平衡
相对于 GPU 资源,增加基于 CPU 的仿真角色数量可以显著加速策略训练。最佳的 CPU/GPU 比例可以确保资源的高效利用,减少瓶颈并提高整体系统性能。建议的 CPU/GPU 比例至少为 1:1(每个 GPU 流多处理器对应一个 CPU 线程),以最大化性能和能效。
目录
13
研究内容二:高级计算范式
14
1.高维计算
HDPG:基于超维策略的强化学习
研究内容二:高级计算范式
15
与基于 DNN 的传统 RL 方法相比,HDPG在 FPGA 平台上实现了 4.7 倍的性能提升和 5.3 倍的能效提高
高维计算的可扩展性问题
16
可重构硬件解决方案
CPU-FPGA平台上的HDQL加速
基于高维计算(HDC)的分布式Q-Learning平台
17
多个agent的分布式异构 CPU-FPGA 平台
脉冲神经网络(Spiking Neural Networks, SNNs)
18
硬件架构模拟神经过程,以优化学习算法的效率。�利用神经尖峰的时序进行计算,显著减少了功耗,与传统方法相比,能效提高了两个数量级
目录
19
量化
20
目录
21
未来研究方向
22
神经处理单元 (NPU) 是专门为增强神经网络计算效率而设计的硬件加速器,特别是乘加运算 (MAC)。虽然 NPU 主要用于深度学习,但其架构也适用于涉及深度神经网络 (DNN) 的 RL 任务。NPU 可以显著提高能效并减少功耗,这对于在功率受限环境中部署 RL 应用至关重要。例如,RENO 芯片设计利用了 RRAM 和 PCM 等非易失性存储器,实现了高达 53.17 TOPS/W 的能效。�NPU 具备多个 MAC 单元,能够高效执行 DNN 计算。此能力可在 RL 任务中加速神经网络的训练和推理,从而减少延迟并提高吞吐量。此外,NPU 内的近似计算技术可以在保持可接受精度的同时提高计算速度,这种权衡对于需要快速决策的动态 RL 环境尤为有利。
未来研究方向
23
RL 中的矢量处理器:并行性和内存处理
矢量处理器传统上优化用于数据并行操作,已展示了在加速机器学习和科学计算中的显著潜力。它们能够同时在多个数据点上执行相同的指令,这使其非常适合 RL 中可并行化的部分,例如神经网络更新和状态与动作的批处理。例如,神经网络的前向传播或多个状态的 Q 值计算可以由矢量处理器高效处理。�
未来研究方向
24
SMCs 结合了内存级并行性 (MLP),并利用内部的片上网络 (NoC) 以实现多个存储库和存储块之间的高速数据传输。通过利用 MLP,SMCs 能够处理 RL 任务中常见的不规则内存访问模式,这些任务中状态、动作和奖励值会在训练的不同阶段频繁更新。根据 Hadidi 等人的研究,HMC 的峰值带宽可达 60 GB/s,相较于传统的基于 DDR 的内存系统有显著提升,后者往往受限于带宽。�
已取得成果
25
Hazem Taha, Yaoliang Bian, Ameer Abdelhadi, “Custom Hardware for Deep Reinforcement Learning: Where We’re Heading”, 在投
校外导师答应在PhD申请时提供推荐信
26
请各位老师批评指正
答辩人:卞耀亮