建立分层 benchmark、契约测试和真实场景测试体系,并优化命令函数解析、事件流重建、本地通知和 send-and-wait 快速路径。
PPO 最核心思想:不能让策略一次性改动太大!,否则训练极易崩溃、震荡。数值小:新旧策略几乎没变化,更新力度太弱,学习慢 数值大:新策略一次性改动过猛,很危险,容易训崩 网上有很多说法,有说0.
starter 增加了 sundablog.contracts: sundablog.
split(','); } // 根据返回的 menuIds 处理树数据,标记每个节点的选中状态(用于界面展示) this.