分层强化学习入门:Options 框架与 PyTorch 实现
为什么要分层(Hierarchical RL)普通强化学习在长时间跨度、稀疏奖励的任务(如机器人多阶段操作、迷宫导航)中学习困难。分层强化学习(Hierarchical Reinforcement Learning, HRL)的核心思想是:把复杂任务分解为可复用的子策略(sub-policy),高层负责选择子目标,低层负责执行。 常见 HRL 框架对比: 框架 高层决策粒度 典型表示 Options 选择子策略(option)并决定何时终止 (I, π, β) 三元组 HAM 部分可编程的有限状态机 机器状态 MAXQ 任务分解为子任务值函数 层次 MDP FeUdal 高层输出隐式目标(goal) 状态抽象 Options 框架的三个要素一个 Option 是一个三元组: 启动集 I(Initiation set):option 可以开始执行的状态集合。 内部策略 π(Policy):option 内部的策略。 终止条件 β(Termination condition):β(s) 表示在状态 s 终止该 option 的概率。 高层策略每 k 步...
YOLOv8 在 RK3576 上的 RKNN 量化部署实战
背景RK3576 是瑞芯微推出的一款 8nm 中高端 AIoT 芯片,内置 6 TOPS NPU,非常适合做端侧目标检测。本文记录将 YOLOv8 部署到 RK3576 的完整流程:PyTorch → ONNX → RKNN(int8 量化)→ C++/Python 端侧推理。 整体流程 阶段 工具 产物 训练/获取权重 PyTorch / Ultralytics yolov8n.pt 导出 ONNX Ultralytics export yolov8n.onnx 转 RKNN + 量化 RKNN-Toolkit2 yolov8n.rknn 端侧推理 RKNN Runtime (librknnrt) C++ / Python 推理程序 1. 导出 ONNX使用 Ultralytics 导出 ONNX,注意关闭动态 shape(RKNN 需要固定尺寸): 12pip install ultralyticsyolo export model=yolov8n.pt format=onnx opset=12 imgsz=6...