- 论文公开站arXiv
信任引导的决策Transformer
Trust Guided Decision Transformer
摘要显示,Decision Transformer 在长程 rollout 中因条件上下文偏离训练分布而性能下降,这种漂移可通过模型自身的下一状态预测误差观察到。作者提出 Trust Guided Decision Transformer(TGDT),先用滚动下一状态预测误差并结合 split conformal prediction 校准阈值筛选可信上下文后缀,再由冻结 critic 在可信后缀中选择最高价值动作。D4RL 导航与运动…
意义:为离线强化学习中的长程决策提供了一种基于模型自检误差的上下文可靠性筛选思路,有助于提升 Decision Transformer 类方法的稳定性。
- 论文公开站arXiv
排斥自注意力的非平衡相:混沌、注意力凝聚与涌现局域性
Nonequilibrium Phases of Repulsive Self-Attention: Chaos, Attention Condensation, and Emergent Locality
摘要研究了一个极简循环 Transformer 的非平衡动力学:N 个归一化 token,Q=K=I,值映射为负 V=-I。相似度注意力选择邻近表示,而负值映射将 token 推离被选场,形成反馈。d=2 时 token 位于圆上,正多边形为精确不动点;随注意力反馈强度 γ 增大,多边形经翻转分岔失稳,出现周期二运动、混沌及簇交换/翻转态。有限 β 下注意力随 N→∞ 仍弥散,凝聚出现在 β~N² 尺度;硬路由极限下出现表示空间的蝴蝶锥…
意义:为理解注意力机制的非平衡动力学提供极简可解析模型,揭示混沌、凝聚与局域化相变,启发对 Transformer 表达与稳定性的理论分析。
- 论文公开站arXiv
通过迭代去对齐估计罕见事件
Rare Event Estimation via Iterative Unalignment
摘要显示,该研究针对自主智能体随机输出轨迹中极稀有但可能灾难性的事件,提出一种新的重要性采样方法:通过可微扰动原模型权重构造提议分布,并联合事件放大可微代理与自适应正则化以平衡放大与估计稳定性。在约1.2亿和26亿参数模型、三类事件族、300多个稀有事件(稀有度低至10^-9)上评估,最可验证设置下相较朴素蒙特卡洛获得超过800倍计算加权效率提升。
意义:为评估自主智能体极端风险提供了可扩展的稀有事件概率估计工具,降低安全部署中风险量化的算力门槛。
- 论文公开站arXiv
学习超越人类可演示的能力
Learning Beyond What Humans Can Demonstrate
摘要显示,针对动态稳定性、精确接触时序或灵巧协调等人类操作者难以甚至无法采集示范数据的任务,作者提出 GLIDE 框架,通过推断任务特定失效模式并将其转化为可执行的「护栏」,用于过滤遥操作与策略指令、约束易失败动作,并依据轨迹反馈迭代改进。在三个任务上,数据采集成功率从 0-10% 提升至 70-90%,策略执行成功率分别达到 70%、60%、60%。
意义:为缺乏人类示范数据的机器人操作任务提供数据采集与策略部署的新思路,护栏机制可降低对专家示范的依赖。
- 论文公开站arXiv
迁移率隙中绝对连续的边缘谱
Don't mind the gap: Absolutely Continuous Edge Spectrum in a Mobility Gap
摘要显示,该研究考察二维晶格哈密顿量与磁薛定谔算子在迁移率间隙中的边缘谱。在适当的局域化与边界假设下,作者证明非零常数体拓扑指标意味着整个间隙区间属于半空间算子的绝对连续谱,且其绝对连续谱重数在几乎处处由该指标的绝对值给出下界。文中还提到第2.3节辅助空间切割构造的初版由ChatGPT 6生成。
意义:为拓扑绝缘体边缘态在迁移率间隙中的稳定性提供严格数学基础,有助于理解无序系统中拓扑保护的谱性质。
- 论文公开站arXiv
λ控制GRPO:将流匹配比率不稳定性转化为预算资源
$λ$-Controlled GRPO: Turning Flow-Matching Ratio Instability into a Budgeted Resource
摘要显示,该研究针对流匹配模型强化学习(Flow-GRPO)中多步去噪训练不稳定的问题,指出重要性比率漂移、离散化、裁剪率差异等看似独立的失效模式实际源于单一的「路径方差」量,该量由采样器的高斯转移核精确决定并可低成本估计。作者提出 λ-Controlled GRPO,依据预测规律校准重要性比率行为,并按预测代价在去噪步间分配梯度预算,两个尺度由标准策略选择固定而非自由调参。在文本到图像模型上以 OCR 评分渲染难目标文本等两种奖励设置…
意义:为流匹配生成模型的强化学习对齐提供了可度量、可预算的稳定性机制,减少对手工调参稳定器的依赖,对图像生成模型的 RL 训练工程有直接参考价值。
- 论文公开站arXiv
分数中心化稳定离策略强化学习
Score Centering Stabilizes Off-policy Reinforcement Learning
摘要显示,大语言模型强化学习对训练引擎与推理引擎之间的微小差异(训练-推理不匹配,TIM)高度敏感,而完全消除 TIM 会显著牺牲 rollout 效率。作者认为 TIM 下 RL 不稳定的主因是「漂移」——训练与推理引擎间随训练步数累积的持续偏差,并提出加性的「分数中心化」修正项来抵消漂移。在 0.6B 至 30B 参数模型上,该方法在量化条件下匹配或优于基于重要性采样的方法,且不匹配越严重优势越大;由于修正是加性的,它还能与重要性采…
意义:为 LLM 强化学习训练中普遍存在的训练-推理引擎不一致问题提供了一种轻量、可组合的稳定性修正,有助于在不牺牲 rollout 效率的前提下提升大规模 RL 训练稳定性。
- 论文公开站arXiv
抑制表面介导退化以增强SiGeSn热稳定性
Enhanced thermal stability of SiGeSn by suppressing surface-mediated degradation
摘要显示,研究利用原位光谱椭偏仪在550°C等温退火下研究Si0.08Ge0.83Sn0.04合金的热稳定性。未覆盖薄膜50分钟后发生相分离,伴随空洞形成、厚度减少60%及E2临界点400 meV蓝移,与表面偏析导致替代位Sn耗尽一致;而覆盖超薄氧化层的薄膜成分变化小于1 at.% Sn、光学偏移小于20 meV,且接触电阻率降低25倍。结果表明表面Sn输运是主要退化路径,氧化层覆盖可扩展亚稳IV族合金的热稳定窗口。
意义:为硅基红外光子学中SiGeSn器件的后处理热预算提供实用解决方案,有助于推动亚稳IV族合金的集成。
- 论文公开站arXiv
基于几何理论的鲁棒公平性审计方法
A Geometric Theory of Robust Fairness Audits
摘要显示,邻近性公平性审计通过比较特征空间中相似个体的预测来评估个体公平性,但其自身鲁棒性未知。微小的特征扰动可能改变局部邻域,导致审计结果不同。研究提出几何框架,建立邻域不变性的充分条件,量化邻域替换对审计不稳定性的传播,并引入审计波动性指标。基准数据集实验支持理论分析,解释此类审计的稳定性。
意义:为公平性审计提供理论保障,帮助开发者理解扰动对审计结果的影响,提升AI系统公平性评估的可靠性。
- 论文公开站arXiv
双维度LLM框架用于大规模测评中题目非内容相似性自动分析
A Dual-Dimensional LLM Framework for Automated Item Incidental Content Similarity Analysis in Large-Scale Assessments
该研究提出一种基于大语言模型的双维度自动题目相似性分析框架,通过结构化分解和语义相关性来检测题目中非内容冗余。心理测量验证显示,LLM指标比传统文本指标更接近构念无关局部依赖,并产生更一致的题目参数分组。在计算机自适应测试中,基于LLM的相似性约束提高了估计稳定性并减少了偏差。
意义:为大规模题库管理提供新方法,提升自适应测试的准确性和效率,对教育测评AI应用有重要价值。
- 论文公开站arXiv
局部蒸馏:实现可解释AI的新方法
Interpretable AI with Local Distillation
摘要提出局部蒸馏方法,通过黑箱教师模型指导正则化线性学生模型,在查询点附近实现高精度与可解释性。教师通过加权相似预测结果的训练观测定义局部性,并利用伪观测锚定拟合。通过高斯随机化评估特征选择稳定性,并在17个基准数据集上验证,局部蒸馏在保持高精度的同时提供透明解释。
意义:该方法为高 stakes 决策提供兼顾准确性与可解释性的模型,有助于增强AI信任度,推动可解释AI在金融、医疗等领域的应用。
- 论文公开站arXiv
惯性流形神经算子用于耗散时间相关偏微分方程
Inertial Manifold Neural Operator for Dissipative Time-Dependent Partial Differential Equations
本文提出惯性流形神经算子(IMNO),用于求解耗散时间相关偏微分方程。摘要显示,该算子利用耗散系统的低维结构,相比标准神经算子(如傅里叶神经算子)在长时间自回归训练和预测中具有更好的物理可解释性、准确性和稳定性。针对平移等变PDE,还提出了平移等变变体(IMNO-SE),通过保持对称性提升性能。
意义:为耗散PDE的长期预测提供更稳定、可解释的神经算子,并引入对称性保持的归纳偏置,对科学计算和AI4Science有重要意义。
- 论文公开站arXiv
SPARCL:基于谱分解的解析持续学习方法
SPARCL: Spectral Partitioned Analytic Continual Learning
SPARCL是一种新的解析持续学习方法,通过将自相关矩阵分解为高能核心和残差部分,仅更新残差块,从而避免旧类特征谱干扰。实验表明,在CIFAR-100、CUB-200等数据集上,SPARCL显著缩小了与强表示匹配方法的差距,并与Fly-CL等方法互补。
意义:为持续学习提供新理论视角,简化更新过程,提升旧类稳定性,对类增量学习场景有实际应用价值。