- 论文公开站arXiv
G-CARL:面向患者导向的医学报告解读的基于清单对齐的奖励学习框架
G-CARL: Grounded Checklist-Aligned Reward Learning for Patient-Oriented Medical Report Interpretation
摘要显示,研究者提出患者导向的医学报告解读(PMRI)任务,要求模型根据用户查询和对话历史,以准确且通俗的语言解释医学报告。为解决事实性和沟通性目标难以联合优化的问题,提出G-CARL框架,结合多源检索进行原子声明验证,并采用上下文感知的加权清单确保响应覆盖,从而提供结构化监督。同时构建了真实世界基准MMedReport和临床医生设计的三维评估协议,实验表明G-CARL在整体质量、声明级精度和清单达成率上优于现有基线。
意义:为医学报告解读提供了兼顾事实性与用户沟通的强化学习框架,并引入新基准,对医疗AI的个性化交互和可验证生成有重要参考价值。
- 论文公开站arXiv
轨迹上的信息:鞅与随机时间
Information on trajectories: martingales and random times
摘要显示,在非负鞅的轨迹路径空间上考虑信息流,可得到精确的变分恒等式,即使在任意随机时间也成立。该恒等式统一了从Ville不等式到PAC-Bayes的经典集中不等式,并量化了每个不等式所丢弃的信息。尾部界限控制的是相对熵,通过链式法则分解为逐步骤的条件散度。在三种几何中,丢弃的松弛量具有精确形式:Gibbs倾斜(用于Azuma-Hoeffding和PAC-Bayes界)、交叉本身(用于Ville和合并检验)以及支配证书(用于Lp最大界)…
意义:该研究为鞅不等式提供了统一框架,可量化各界的松弛量,对在线统计和机器学习中的安全测试、置信序列设计有重要指导意义。