- 论文公开站arXiv
ScienceBuddy:面向交互式科学智能体的递归自改进
ScienceBuddy: Recursive-in-Recursive Self-Improvement for Interactive Scientific Agents
摘要显示,ScienceBuddy 是一个交互式科研工作空间,将可持续改进的科学智能体嵌入研究者日常工作流,把研究者的请求、反馈与执行证据转化为任务和评估标准以支持持续学习。其核心为「递归中的递归」自我改进范式:内层递归在模型固定下改进 harness,外层递归在改进后的 harness 下训练模型,两者相互促进。案例研究覆盖四个科学任务族,并以研究产品形式开源发布。
意义:将 agent 脚手架演进与模型强化学习嵌套耦合,为持续自我改进型智能体提供了可复用的工程范式与开源产品参考。
- 开源项目公开站GitHub
MuJoCo:通用物理模拟器
google-deepmind/mujoco — Multi-Joint dynamics with Contact. A general purpose physics simulator.
google-deepmind/mujoco 是 Google DeepMind 维护的开源通用物理模拟器,全称 Multi-Joint dynamics with Contact,用于多关节动力学与接触仿真,GitHub 星标约 15161,常用于机器人、强化学习与具身智能研究。
意义:MuJoCo 是机器人控制与强化学习的主流仿真环境,DeepMind 开源后降低了具身智能研究的仿真门槛。
- 论文公开站arXiv
离线强化学习中的边际重要性加权:保序贝尔曼校准方法
Bellman Calibration for Marginalized Importance Weighting in Offline Reinforcement Learning
摘要提出了一种名为保序贝尔曼校准的一维模型无关后处理方法,用于减少离线强化学习中边际重要性加权估计的占用率平衡违规。该方法通过拟合非递减变换类来校正初始估计的尺度和形状,并具有校准-细化界限,保证小校准误差的估计性能接近最优后处理。同时建立了有限样本校准保证和KL oracle不等式。
意义:该方法为离线强化学习中的重要性加权估计提供了可诊断的校正手段,有助于提升策略评估的可靠性,对模型选择和超参数调优有实际意义。
- 论文公开站arXiv
通过局部增强偏好与表示解缠改进跨问题车辆路径规划
Improving Cross-Problem Vehicle Routing with Locally Augmented Preferences and Representation Disentanglement
摘要显示,多任务车辆路径问题求解器面临训练监督弱和架构纠缠的挑战。为此,提出POLAR训练算法,通过局部搜索细化最佳解码路径以形成更优偏好对,以及PLE编码器,利用门控机制分离共享专家与任务特定专家,逐步解缠通用路由结构与约束特定编码。实验表明,两者结合可提升当前最先进性能。
意义:对开发者而言,该研究提供了训练算法与架构设计的改进,有望提升多任务VRP模型的泛化能力与训练效率,推动实际物流调度应用。
- 论文公开站arXiv
SPO++:面向异步智能体强化学习的流对齐策略优化
SPO++: Stream-Aligned Policy Optimization for Asynchronous Agentic RL
摘要介绍SPO++,一种改进的异步智能体强化学习算法。针对组相对强化学习等待同提示兄弟rollout的高成本,SPO使用持久提示级价值估计,但轨迹中心化未能正确居中行动者消费的token加权量。SPO++通过标准化行动token度量下的终端结果优势来修正,并依据策略事件而非接收顺序组织提示证据。在ALFWorld和Math-TIR上的实验显示,SPO++相比SPO提升了在线学习效率,消融实验表明行动token度量归一化是最有效的组件。
意义:为异步智能体强化学习提供更高效的策略优化方法,减少等待成本,提升在线学习效率,对长工具使用轨迹的智能体训练有重要意义。
- 论文公开站arXiv
BPCO:一种稳定高效的评论家训练方法
How to Train a Critic Stably and Efficiently
摘要显示,基于组的强化学习方法(如GRPO)通过采样多个响应避免训练评论家,但标准评论家训练常不稳定。研究者提出BPCO配方,结合DPPO、奖励范围限定的值预测、蒙特卡洛值目标、未归一化策略优势及长度自适应GAE,并可在训练时向评论家提供奖励定义信息。在数学推理任务中,BPCO一致提升强评论家基线,并匹配或超越组基线,同时每个提示仅采样一个响应。
意义:为LLM强化学习提供稳定高效的评论家训练方案,减少采样成本,提升训练可靠性,对在线RL算法设计有重要参考价值。
- 论文公开站arXiv
Re³Cap:基于检索引导的强化学习图像描述优化方法
Re$^3$Cap: Retrieval-Guided Refinement for Image Captioning Enhancement via Reinforcement Learning
Re³Cap提出一种检索引导的推理策略,用于增强图像描述生成,无需额外标注。该方法通过描述细化建议器和质量评估器,识别并修正描述中的幻觉与遗漏,从而生成更准确、详细的描述。实验表明,在COCO-LN500基准上,Re³Cap在关系推理任务上平均比GRPO提升8.64%,甚至优于监督微调方法。
意义:该方法利用多模态检索作为推理信号,提升强化学习在图像描述中的探索能力,为无需额外标注的模型优化提供了新思路。
- 论文公开站arXiv
MidTool:面向智能体工具使用的中期训练数据合成
MidTool: Mid-training Data Synthesis for Agentic Tool Use
摘要显示,MidTool是一个用于智能体工具使用中期训练的开源语料构建流程,整合大规模网页、PDF和代码数据,并利用真实工具API、MCP技能和文档相关工作流合成监督信号。该流程旨在教会模型识别工具功能、从上下文获取参数、组合工具调用工作流并从不完整信息中恢复。在Qwen3-4B-Base和Qwen3-8B-Base上进行中期训练,并配合监督微调和强化学习,MidTool-Mix在BFCL、tau2-Bench和MCP Universe…
意义:为通用工具使用提供专门的中期训练方法,提升模型在真实工具调用场景中的能力,对智能体开发具有重要意义。
- 论文公开站arXiv
G-CARL:面向患者导向的医学报告解读的基于清单对齐的奖励学习框架
G-CARL: Grounded Checklist-Aligned Reward Learning for Patient-Oriented Medical Report Interpretation
摘要显示,研究者提出患者导向的医学报告解读(PMRI)任务,要求模型根据用户查询和对话历史,以准确且通俗的语言解释医学报告。为解决事实性和沟通性目标难以联合优化的问题,提出G-CARL框架,结合多源检索进行原子声明验证,并采用上下文感知的加权清单确保响应覆盖,从而提供结构化监督。同时构建了真实世界基准MMedReport和临床医生设计的三维评估协议,实验表明G-CARL在整体质量、声明级精度和清单达成率上优于现有基线。
意义:为医学报告解读提供了兼顾事实性与用户沟通的强化学习框架,并引入新基准,对医疗AI的个性化交互和可验证生成有重要参考价值。