跳到正文
SJTU王锐学长 / douyin· SJTU王锐学长·发布时间:评分23
图文

强化学习多目标优化:自适应算子选择与安全约束处理两项改进

强化学习多目标优化 两个创新。同学要发JCR三区,做的方向是关于多目标优化的。需要在一堆复杂的制约条件下,怎么同时优化多个目标,我来做两个创新和实验 核心创新主要是围绕频段-频谱这块的自适应算子选择机制,核心就是让算法能根据搜索阶段灵活调整

内容导读

SJTU王锐学长分享了在复杂约束下同时优化多个目标的实验。两项改进围绕频段—频谱展开:让算法随搜索阶段调整算子,也就是搜索操作的选择策略;优化安全约束处理,让搜索在满足约束的范围内更流畅。作者报告,pb-aos 相比 baseline 的 hv 从0.6075升至0.7340,提升20.82%,igd+下降52.04%,在5个子问题上整体表现较稳定。

来源:SJTU王锐学长 / douyin · douyin.com