- 论文公开站arXiv
交错强化学习让统一模型学会原生反思
Learning Native Reflection in Unified Models with Interleaved Reinforcement Learning
统一多模态模型既能看图又能生成图,原则上可自我修复生成结果:诊断错误、修改、观察再诊断;但修改是否有益只有渲染后才能知晓。
- 论文公开站arXiv
PDMD:面向视频扩散模型的投影分布匹配蒸馏
PDMD: Projected Distribution Matching Distillation for Video Diffusion Models
现代视频扩散模型需在长时空Token序列上进行数十次去噪评估,分布匹配蒸馏(DMD)可将函数评估次数降至几次,但DMD样本在训练中会退化。
- 论文公开站arXiv
伸缩式语言模型
Telescopic Language Models
一个已部署的语言模型常需服务多种算力预算,而每个预算点仍需单独训练或压缩;本文训练伸缩式语言模型(TLM)作为连续体,由随机前缀监督的嵌套容量Transformer构成。
- 论文公开站arXiv
FurE:无需动物毛发数据集的高效实例级3D毛发重建
FurE: Efficient Instance-Specific 3D Fur Reconstruction without Animal-Fur Datasets
从多视角图像重建逼真可编辑的动物毛发面临精细细节、自遮挡与混淆等挑战,且不同于人类头发,缺乏动物毛发数据集。
- 论文公开站arXiv
通过发现时间解释中的重复概念揭示音频分类器中的捷径学习
Uncovering shortcut learning in audio classifiers by discovering recurring concepts in temporal explanations
机器学习数据集中事件间的相关性可能导致捷径学习,模型基于相关事件的出现来预测目标事件。当这些相关性是虚假的(源于数据收集偏差)时,模型很可能学到错误关联。
- 论文公开站arXiv
后验机制与潜在欺骗:隐马尔可夫模型中的变分贝叶斯推断用于序列欺诈检测
Posterior Regimes and Latent Deception: Variational Bayesian Inference in Hidden Markov Models for Sequential Fraud Detection in Financial Transactions
我们提出隐马尔可夫模型的三层递进:最大似然(Baum-Welch)、变分贝叶斯(VBEM)及神经变分扩展(Neural VBEM),将每位客户的交易历史建模为少数潜在行为状态的轨迹。
- 论文公开站arXiv
ADPTNet:面向序列建模的自适应规定时间尺度非线性 SSM
ADPTNet: Adaptive with Prescriptive Timescales Non-Linear SSM for Sequence Modelling
神经形态计算的核心目标是提供高能耗 Transformer AI 的可行替代方案。然而,高效替代方案难以捕捉使 Transformer 成为序列建模事实标准的一系列特性。
- 论文公开站arXiv
基于状态空间模型的 3D 点跟踪
3D Point Tracking with State Space Models
在度量 3D(绝对米制,而非未知尺度)中跟踪动态场景的任意点,支撑着 3D/4D 重建、机器人导航和自动驾驶——这些场景以米而非像素做决策。我们的目标是构建在此类场景中精确的 3D 点跟踪器。
- 论文公开站arXiv
UOPD:多轮智能体同策略蒸馏中的不确定性感知干预
UOPD: Uncertainty-Aware Intervention for On-Policy Distillation of Multi-Turn Agents
同策略蒸馏(OPD)利用教师的密集监督在学生自身轨迹上训练。在多轮环境中,关键决策步骤的错误可能使后续轨迹走向糟糕结果。我们利用教师对学生动作的低置信度进行干预。
- 论文公开站arXiv
大语言模型用于结构化临床数据分析:双智能体接地与验证
Large Language Models for Structured Clinical Data Analysis: Dual-Agent Grounding and Validation
目标:开发并表征 CLEAR-Med,一种用于结构化临床数据自然语言分析的双智能体框架,将基于 SQL 的调用与独立验证分离。方法:CLEAR-Med 使用一个智能体将问题转化为可执行的结构化查询。
- 论文公开站arXiv
约束强化学习中的视觉-语言信号:安全增益但无预判能力
Vision--Language Signals in Constrained RL: Safety Gains Without Anticipation
安全强化学习寻求在满足安全约束的同时最大化任务性能的策略。然而在驾驶基准中,碰撞成本通常仅在碰撞时出现,无法提前预警逼近的危险。冻结的视觉-语言模型被用于提供信号。
- 论文公开站arXiv
非负矩阵分解的奇异性及其在贝叶斯推断中的应用
Singularities of Non-negative Matrix Factorization and their application to Bayesian inference
非负矩阵分解(NMF)是一种奇异统计模型,其贝叶斯渐近性由实对数规范阈值(RLCT)决定。我们研究分解映射的局部几何,并推导出 NMF 的 RLCT 上界。
- 论文公开站arXiv
Kafila:在可信异构消费级机器集合上服务大语言模型
Kafila: Serving Large Language Models on a Trusted Set of Heterogeneous Commodity Machines
研究组成员或朋友圈各自拥有几台消费级计算机,但单台都不足以运行一个有能力的大语言模型。现有系统在开放集群中汇聚此类算力,而仅接纳可信机器的群体则无法使用。
- 论文公开站arXiv
ARCH-B:建筑表征、理解与层级基准
ARCH-B: Architectural Representation, Comprehension and Hierarchy Benchmark
多模态模型越来越多地解读视觉环境,但其在照片、平面图、立面图、剖面图和渲染图中识别同一建筑的能力仍缺乏表征。我们推出 ARCH-B,一个包含 354 道四选一题的基准。
- 论文公开站arXiv
跳出框框:滑动窗口 KV 推理中的信息保留与传递
Thinking Outside the Box: Retention and Transmission of Information in Sliding-Window KV Inference
滑动窗口 KV 推理指增量处理序列,仅保留固定大小的近期键值状态缓存。它可在推理时应用于预训练因果 Transformer 而无需额外训练,同时其 KV 缓存内存保持固定。
- 论文公开站arXiv
带反馈的因果发现的统计代价
The Statistical Cost of Causal Discovery with Feedback
什么决定了学习循环因果结构不可避免的样本代价?针对循环线性非高斯模型,我们研究从观测数据中精确恢复凝聚结构:识别强连通分量(SCC)划分及分量间所有边。
- 论文公开站arXiv
PReCache:通过低秩预计算与中性重建实现多 LoRA 智能体的高效 KV 缓存共享
PReCache: Efficient KV Cache Sharing for Multi-LoRA Agents via Low-Rank Precomputation and Neutral Reconstruction
多 LoRA 智能体系统通过共享公共骨干模型实现高效角色专业化。然而,每个智能体重复处理不断增长的共享轨迹并构建自己的 KV 缓存,在长时程任务中造成大量内存和计算冗余。
- 论文公开站arXiv
在 CP2K 中原生实现机器学习 Skala 交换关联泛函:统一单中心重建
Native implementation of the machine-learned Skala exchange-correlation functional in CP2K: Unified one-centre reconstruction for molecular and condensed-phase calculations
我们使用 CP2K 的高斯与平面波(GPW)及高斯与增强平面波(GAPW)方法,原生实现机器学习 Skala 交换关联(XC)泛函。对密度、密度梯度和动能密度进行联合单中心重建。
- 论文公开站arXiv
用价值移植引导语言模型目标
Steering Language Model Goals with Value Transplant
推理模型常表现得仿佛在追求目标,但其努力并不总指向用户意图,有时导致意外结果。先前工作研究了模型如何通过“价值”内部追踪其目标进展。
- 论文公开站arXiv
适应AI:小学教师如何调整教学实践以融入AI课程
Adapting for AI: How elementary teachers adjust their practices for an AI-integrated curriculum
摘要显示,该研究追踪三名小学教师在为期13天、三周夏令营中实施围绕ToyTalk会话AI玩具开发平台构建的AI素养与英语语言艺术课程。基于每日个人反思、小组反思及营后访谈,研究发现教师的修复、差异化、翻译与平衡等适应性实践处于技术、学习者与教学三重张力交汇处,且教师对AI及自身角色的理解随营期经历演变。研究据此提出在小学课堂部署会话AI的设计启示与考量。
意义:为教育AI产品设计者与课程开发者提供一线教师适应性实践的实证依据,有助于让会话AI工具更贴合小学课堂真实教学情境。
- 论文公开站arXiv
深度粗糙波动率中的不确定性与可解释性:神经信息论后验方法
Uncertainty and Explainability in Deep Rough Volatility: A Neural Information-Theoretic Posterior Approach
摘要显示,该研究提出基于模拟推断的粗糙 Heston(rHeston)校准框架,利用神经比率估计学习隐含波动率曲面条件下的参数后验分布,并将后验样本传播至异方差神经代理定价器,得到融合参数残差不确定性与代理条件不确定性的后验预测价格区间。作者还提出 Hellinger-SHAP,一种以后验信息泛函为对象的可解释性方法,用于识别各参数信息增益对应的期限-行权价区域。模拟研究表明,后验预测区间在远期启动、障碍与方差互换类合约上覆盖率合理或保…
意义:为波动率模型校准提供不确定性量化与可解释性工具,提示开发者仅用点估计定价可能不可靠,需关注后验预测区间。
- 论文公开站arXiv
OC-GS:面向不规则转台拍摄的高斯泼溅重建
OC-GS: Gaussian Splatting for Irregular Turntable Capture
摘要显示,针对转台拍摄中旋转不均与丢帧导致等角度假设失效的问题,OC-GS 提出以物体为中心的高斯泼溅方法,在共享相机、旋转轴与枢轴的前提下细化每张图像的拍摄角度,联合优化图像几何与角度。在 12、8、6 个不规则视角下,前景 PSNR 分别为 21.26、19.36、15.83dB,均优于四个无位姿高斯泼溅基线;共享训练器下细化角度比固定估计提升 7.88dB,真实拍摄提升 0.70dB。
意义:为稀疏、不规则转台拍摄提供无需精确位姿的三维重建思路,对低成本物体扫描与高斯泼溅应用有参考价值。
- 论文公开站arXiv
生成、跟踪、改进:基于RL微调运动生成器的感知型多技能人形机器人运动
Generate, Track, Improve: Perceptive Multi-Skill Humanoid Locomotion with RL-Fine-Tuned Motion Generators
摘要显示,该工作提出双层运动架构:感知式流匹配运动生成器从原始深度图规划全身轨迹,控制引导强化学习训练的感知跟踪策略执行动作。核心贡献是一种离策略强化学习微调循环,通过结构化搜索采集数据并进行优势加权回归,提升生成器在未见地形与技能组合上的一致性。摘要称地形通过成功率最高提升25个百分点,技能选择提升80个百分点;使用原始深度图无需里程计或高度图,单对策略即可驱动Unitree G1完成走、跑、站立与跳跃等动作。
意义:为开发者提供一种样本高效的离策略微调范式,使多技能人形机器人仅凭深度图即可适应复杂地形,降低感知与部署门槛。
- 论文公开站arXiv
信任引导的决策Transformer
Trust Guided Decision Transformer
摘要显示,Decision Transformer 在长程 rollout 中因条件上下文偏离训练分布而性能下降,这种漂移可通过模型自身的下一状态预测误差观察到。作者提出 Trust Guided Decision Transformer(TGDT),先用滚动下一状态预测误差并结合 split conformal prediction 校准阈值筛选可信上下文后缀,再由冻结 critic 在可信后缀中选择最高价值动作。D4RL 导航与运动…
意义:为离线强化学习中的长程决策提供了一种基于模型自检误差的上下文可靠性筛选思路,有助于提升 Decision Transformer 类方法的稳定性。
- 论文公开站arXiv
面向编程代理的紧凑文档:基准、优化器及为何无法迁移
Compact Documentation for Coding Agents: A Benchmark, an Optimizer, and Why It Does Not Transfer
摘要显示,研究者构建了一个往返基准,用「由描述重新生成的代码能否通过原测试」来评分代码描述质量,发现完整性而非长度决定描述保真度;并据此优化出可泛化到未见文件的描述生成提示。但跨两个模型家族、十个仓库的测试表明,在源码存在时,静态紧凑文档或检索上下文均无法帮助代理解决真实仓库问题,作者将此负面结果连同基准与优化器一并报告。
意义:提示开发者:为编码代理生成文档未必提升真实任务表现,评估代理上下文策略需谨慎,避免无效投入。