- 论文公开站arXiv
基于VLM智能体的上下文机器人学习
In-Context Robot Learning with VLM Agents
摘要显示,该研究提出 GPT-Policy,一种面向上下文机器人学习的通用智能体框架,整合了保留任务相关视觉过渡的上下文编译器、提出机器人工具动作的视觉语言模型(VLM),以及验证并执行动作、反馈结果的受限控制器。在真实机器人试验中,人类视频演示即使没有机器人动作标签也能提升任务完成率,对齐的动作参考在接触敏感任务上带来进一步增益,无需梯度更新或持久修改任务参数。
意义:为机器人泛化提供无需微调的新范式,降低部署成本,并凸显VLM作为机器人策略核心组件的潜力。
- 论文公开站arXiv
LLM偏好对齐的零阶范式
A Zeroth-Order Paradigm for LLM Preference Alignment
摘要显示,该论文提出并分析了一种基于比较预言机的零阶对齐方法 ComPO,用于从偏好对中提取方向信息,而不直接优化可微的偏好损失,以缓解似然位移问题。作者给出了离线基础方案在平滑性、梯度稀疏性与预言机-潜在目标兼容性假设下的收敛保证,并引入在线 ComPO,利用无标注策略生成做相对参考策略的反向 KL 控制,在局部覆盖与分布内成对奖励准确率下给出性能保证。在 Mistral、Llama、Gemma-2、Qwen3、Gemma-3 上的实…
意义:为 LLM 偏好对齐提供不依赖可微偏好损失的零阶替代路径,并给出理论保证,可能缓解似然位移并影响对齐算法设计。
- 论文公开站arXiv
LACE:面向动态帧率编解码器的逐层压缩
LACE: Layer-Wise Compression for Dynamic Frame Rate Codecs
摘要显示,神经音频编解码器帧率高导致序列过长、计算成本上升,动态帧率编解码器通过压缩步骤合并多帧来缓解。但已有方法多针对单码本,或在多层量化前只做一次压缩,使各量化层共享相同分段边界,而不同层的残差嵌入随时间变化速率不同。作者提出 LACE(Layer-Adaptive Codec Encoding),在每个量化层独立压缩以支持层特定分段边界,并引入联合对齐与边界锚机制,用于下游 TTS。LibriTTS 实验显示其在重建的率-质量权衡…
意义:为语音语言模型与 TTS 提供更高效的 token 压缩方案,降低序列长度与推理成本,代码已并入 ESPnet3。
- 资讯公开站Nature News
用于 X 射线到体数据配准的快速患者个性化神经网络
Rapid patient-specific neural networks for X-ray to volume registration
该研究提出一种快速构建患者个性化神经网络的方法,用于将 X 射线图像与三维体数据(如 CT)进行配准。方法针对单个患者快速训练网络,以提升配准精度与速度,服务于影像引导等场景。
意义:将患者个性化神经网络引入医学影像配准,有望提升术中X光与CT对齐的实时性与精度,对医学AI与影像引导开发有参考价值。
- 论文公开站arXiv
SPO++:面向异步智能体强化学习的流对齐策略优化
SPO++: Stream-Aligned Policy Optimization for Asynchronous Agentic RL
摘要介绍SPO++,一种改进的异步智能体强化学习算法。针对组相对强化学习等待同提示兄弟rollout的高成本,SPO使用持久提示级价值估计,但轨迹中心化未能正确居中行动者消费的token加权量。SPO++通过标准化行动token度量下的终端结果优势来修正,并依据策略事件而非接收顺序组织提示证据。在ALFWorld和Math-TIR上的实验显示,SPO++相比SPO提升了在线学习效率,消融实验表明行动token度量归一化是最有效的组件。
意义:为异步智能体强化学习提供更高效的策略优化方法,减少等待成本,提升在线学习效率,对长工具使用轨迹的智能体训练有重要意义。
- 论文公开站arXiv
基于物理约束深度学习的非接触式三轴体震信号血压监测模型
Physics-Constrained Deep Learning Model for Contactless Blood Pressure Monitoring from Triaxial Bodyseismography
本文提出Phy-BP框架,用于基于三轴体震信号(BSG)的非接触式血压监测。该框架包含自适应质量控制算法,筛选富含心源性成分的BSG段,并建立物理模型描述体-床系统中的三维波传播,嵌入深度学习模型以对齐多轴特征。在21名受试者162小时医院数据集上,Phy-BP能动态过滤低质量测量,并通过物理一致性约束提升模型鲁棒性,尤其在训练样本有限时表现良好。
意义:该研究将物理模型与深度学习结合,提升非接触式血压监测的鲁棒性和泛化能力,对可穿戴健康监测和AI医疗应用具有重要意义。
- 论文公开站arXiv
注入、对齐、恢复:面向无检索文档知识内化的分阶段后训练框架
Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization
大型语言模型在推理时无法检索源文档时,往往难以回答关于特定文档集的问题。为此,本文提出IAR(注入、对齐、恢复)三阶段后训练框架,将固定语料转化为可用的参数化知识,实现无检索问答。注入阶段采用续写、改写和指令条件重建目标;对齐阶段使用仅答案的问答监督;恢复阶段合并领域适配模型与基础指令模型以恢复通用能力。实验显示,在多个模型家族和数据集上,IAR在领域问答准确率上平均提升3.6个百分点,通用性能平均提升12.1个百分点。
意义:该框架为无需检索的文档知识内化提供了新方法,提升领域问答准确率的同时保持通用能力,对构建高效、实用的领域专用模型具有重要意义。
- 论文公开站arXiv
G-CARL:面向患者导向的医学报告解读的基于清单对齐的奖励学习框架
G-CARL: Grounded Checklist-Aligned Reward Learning for Patient-Oriented Medical Report Interpretation
摘要显示,研究者提出患者导向的医学报告解读(PMRI)任务,要求模型根据用户查询和对话历史,以准确且通俗的语言解释医学报告。为解决事实性和沟通性目标难以联合优化的问题,提出G-CARL框架,结合多源检索进行原子声明验证,并采用上下文感知的加权清单确保响应覆盖,从而提供结构化监督。同时构建了真实世界基准MMedReport和临床医生设计的三维评估协议,实验表明G-CARL在整体质量、声明级精度和清单达成率上优于现有基线。
意义:为医学报告解读提供了兼顾事实性与用户沟通的强化学习框架,并引入新基准,对医疗AI的个性化交互和可验证生成有重要参考价值。