复杂系统决策和大模型对齐中的强化学习
针对复杂系统决策与大模型对齐中模型未知、反馈稀疏、环境非平稳等特点,研究从交互与控制数据中学习动力学与奖励模型、策略的自主演化与在线迁移、大模型预训练与后训练中的强化学习优化机理等,建立涵盖仿真环境与大模型训练的学习与决策验证平台,包含代理模型与奖励模型精度测试场景、策略探索与样本效率测试场景、大规模训练优化器与稳定性测试场景、多智能体协同决策与鲁棒性测试场景、数据采集与分析系统等,实现电力、交通、能源等垂域场景的策略自主学习与实时决策,以及大模型在推理与对齐任务中的后训练策略优化,提高智能体与模型在强扰动、信息不完全条件下的自适应能力

