- 论文公开站arXiv
带反馈的因果发现的统计代价
The Statistical Cost of Causal Discovery with Feedback
什么决定了学习循环因果结构不可避免的样本代价?针对循环线性非高斯模型,我们研究从观测数据中精确恢复凝聚结构:识别强连通分量(SCC)划分及分量间所有边。
- 论文公开站arXiv
在 CP2K 中原生实现机器学习 Skala 交换关联泛函:统一单中心重建
Native implementation of the machine-learned Skala exchange-correlation functional in CP2K: Unified one-centre reconstruction for molecular and condensed-phase calculations
我们使用 CP2K 的高斯与平面波(GPW)及高斯与增强平面波(GAPW)方法,原生实现机器学习 Skala 交换关联(XC)泛函。对密度、密度梯度和动能密度进行联合单中心重建。
- 论文公开站arXiv
适应AI:小学教师如何调整教学实践以融入AI课程
Adapting for AI: How elementary teachers adjust their practices for an AI-integrated curriculum
摘要显示,该研究追踪三名小学教师在为期13天、三周夏令营中实施围绕ToyTalk会话AI玩具开发平台构建的AI素养与英语语言艺术课程。基于每日个人反思、小组反思及营后访谈,研究发现教师的修复、差异化、翻译与平衡等适应性实践处于技术、学习者与教学三重张力交汇处,且教师对AI及自身角色的理解随营期经历演变。研究据此提出在小学课堂部署会话AI的设计启示与考量。
意义:为教育AI产品设计者与课程开发者提供一线教师适应性实践的实证依据,有助于让会话AI工具更贴合小学课堂真实教学情境。
- 论文公开站arXiv
深度粗糙波动率中的不确定性与可解释性:神经信息论后验方法
Uncertainty and Explainability in Deep Rough Volatility: A Neural Information-Theoretic Posterior Approach
摘要显示,该研究提出基于模拟推断的粗糙 Heston(rHeston)校准框架,利用神经比率估计学习隐含波动率曲面条件下的参数后验分布,并将后验样本传播至异方差神经代理定价器,得到融合参数残差不确定性与代理条件不确定性的后验预测价格区间。作者还提出 Hellinger-SHAP,一种以后验信息泛函为对象的可解释性方法,用于识别各参数信息增益对应的期限-行权价区域。模拟研究表明,后验预测区间在远期启动、障碍与方差互换类合约上覆盖率合理或保…
意义:为波动率模型校准提供不确定性量化与可解释性工具,提示开发者仅用点估计定价可能不可靠,需关注后验预测区间。
- 论文公开站arXiv
连续流心室辅助装置集成系统架构的高效生理控制
Efficient physiological control of an integrated system architecture for continuous-flow ventricular assist devices: in-silico study
摘要显示,该研究提出并评估了一套用于连续流心室辅助装置(VAD)生理控制的集成系统架构(ISA)。控制器基于VAD流入插管的压力测量估算心率和心室充盈压,动态调节转速以优化装置与患者交互。在27个仿真场景中,转速相对基线6000 rpm调整范围为-10%(-600 rpm)至+43%(+2600 rpm),消除了无控制条件下出现的12例心室抽吸与回流事件,并观察到左心室射血分数、心肌氧耗、氧输送及心脏功率等血流动力学与代谢指标的改善。
意义:为VAD智能闭环控制提供仿真验证路径,展示基于压力传感的生理自适应调速可减少抽吸等不良事件,对医疗AI与植入式设备控制算法开发者有参考价值。
- 论文公开站arXiv
用于高效端侧LLM生成式个性化的LoRA生成超网络
LoRA-generating hypernetworks for efficient on-device LLM generative personalization
摘要显示,该论文提出一种设备端LLM个性化方法:训练超网络将用户上下文token映射为适合该用户的LoRA,部署后在设备端合成个性化LoRA。该方法结合了上下文学习(ICL)与参数高效微调(PEFT)的优点:设备端阶段仅需前向传播,计算可行;同时通过权重修改基础模型,避免扩展输入序列带来的延迟增加,尤其适合移动设备场景。
意义:为移动端LLM个性化提供无需反向传播的可行路径,降低设备端算力与延迟门槛,对端侧AI应用开发有参考价值。
- 论文公开站arXiv
迁移率隙中绝对连续的边缘谱
Don't mind the gap: Absolutely Continuous Edge Spectrum in a Mobility Gap
摘要显示,该研究考察二维晶格哈密顿量与磁薛定谔算子在迁移率间隙中的边缘谱。在适当的局域化与边界假设下,作者证明非零常数体拓扑指标意味着整个间隙区间属于半空间算子的绝对连续谱,且其绝对连续谱重数在几乎处处由该指标的绝对值给出下界。文中还提到第2.3节辅助空间切割构造的初版由ChatGPT 6生成。
意义:为拓扑绝缘体边缘态在迁移率间隙中的稳定性提供严格数学基础,有助于理解无序系统中拓扑保护的谱性质。
- 论文公开站arXiv
Gricea:面向对话式AI研究的开放科学平台
Gricea: An Open Science Platform for Conversational AI Research
摘要显示,对话式 AI(CAI)研究缺乏统一的系统与实验配置报告方式,阻碍复现与知识积累。作者提出 Gricea,一个将研究表示为可配置、可部署研究制品的开放科学平台,整合研究流程、被试界面与对话任务行为。在一项复现研究中,Gricea 复现了 CUI 2026 中 93% 符合条件的论文配置,同时指出 96% 论文存在阻碍忠实复现的信息缺失。用户研究显示不同背景研究者可成功构建可运行研究。
意义:为对话式 AI 研究提供可复现、可共享的实验基础设施,有助于缓解复现危机并推动累积式知识构建。
- 论文公开站arXiv
λ控制GRPO:将流匹配比率不稳定性转化为预算资源
$λ$-Controlled GRPO: Turning Flow-Matching Ratio Instability into a Budgeted Resource
摘要显示,该研究针对流匹配模型强化学习(Flow-GRPO)中多步去噪训练不稳定的问题,指出重要性比率漂移、离散化、裁剪率差异等看似独立的失效模式实际源于单一的「路径方差」量,该量由采样器的高斯转移核精确决定并可低成本估计。作者提出 λ-Controlled GRPO,依据预测规律校准重要性比率行为,并按预测代价在去噪步间分配梯度预算,两个尺度由标准策略选择固定而非自由调参。在文本到图像模型上以 OCR 评分渲染难目标文本等两种奖励设置…
意义:为流匹配生成模型的强化学习对齐提供了可度量、可预算的稳定性机制,减少对手工调参稳定器的依赖,对图像生成模型的 RL 训练工程有直接参考价值。
- 论文公开站arXiv
BrainWideBench:多区域神经记录的大规模预训练与跨动物迁移基准
BrainWideBench: Benchmarking large-scale pretraining and across-animal transfer in multi-region neural recordings
摘要显示,该工作提出 BrainWideBench,用于评估多区域神经记录上的跨动物迁移能力,数据基于国际脑实验室 Brainwide Map,覆盖 139 只小鼠、276 个脑区。基准包含三类任务:行为解码、掩码或未来神经活动预测,以及解剖组织结构的恢复。结果显示预训练优于单会话基线,但迁移收益高度依赖预训练目标与下游任务的对齐程度,没有单一方法在全部任务上普遍最优。
意义:为神经基础模型提供统一评测协议,提示开发者预训练目标需与下游任务对齐,而非追求通用表征。
- 论文公开站arXiv
编码智能体测试框架设计的实证研究
An Empirical Study of Harness Design for Coding Agents
该研究用轻量级编码框架在固定执行循环下,分别变化规划、动作空间与上下文管理三个组件,在 SWE-Bench Verified 与 Terminal-Bench 2.1 上对四个模型评测了 176 组匹配设置。摘要显示:上下文预算收紧时上下文管理价值上升,收益主要来自避免上下文溢出;规则式删减先于 LLM 摘要效率最佳;规划对弱模型提升准确率、对强模型主要节省成本;预定义工具利好 bash 能力弱的模型,而 bash 强模型用纯 bash…
意义:为构建编码智能体的开发者提供组件级实证依据,说明上下文管理、规划与工具接口应按模型能力与预算差异化设计,而非整体堆叠。
- 论文公开站arXiv
LLM何时应弃答?用于选择性风险控制的自问链
When Should LLMs Abstain? Chain-of-Self-Questioning for Selective Risk Control
摘要显示,论文提出仅靠提示词的 Chain-of-Self-Questioning(CoSQ)框架,让模型在明确评估回答问题所需信息后再决定是否作答。在 TruthfulQA 817 题多选题验证集上,用 11 个开源与托管模型家族测试 17 种条件:平衡选项协议下 Grounded-CoSQ(τ=0.90)将平均无条件错误作答率从思维链提示的 13.1% 降至 8.9%,相对下降 32.1%,作答准确率由 86.9% 升至 89.7%…
意义:为开发者提供无需训练、可调阈值的拒答机制,在高风险场景中以可控覆盖率降低无依据作答风险。
- 论文公开站arXiv
BPCO:一种稳定高效的评论家训练方法
How to Train a Critic Stably and Efficiently
摘要显示,基于组的强化学习方法(如GRPO)通过采样多个响应避免训练评论家,但标准评论家训练常不稳定。研究者提出BPCO配方,结合DPPO、奖励范围限定的值预测、蒙特卡洛值目标、未归一化策略优势及长度自适应GAE,并可在训练时向评论家提供奖励定义信息。在数学推理任务中,BPCO一致提升强评论家基线,并匹配或超越组基线,同时每个提示仅采样一个响应。
意义:为LLM强化学习提供稳定高效的评论家训练方案,减少采样成本,提升训练可靠性,对在线RL算法设计有重要参考价值。
- 论文公开站arXiv
短期定价面板中的跨设计不确定性:来自模拟价格轨迹的证据
Across-Design Uncertainty in Short Pricing Panels: Evidence from Simulated Price Trajectories
摘要显示,短期观测定价面板可能包含大量观测值,但只有少数不同的价格变动。研究在稀疏定价机制下,区分了条件于已实现价格轨迹的不确定性与同一定价过程产生的替代轨迹之间的估计误差变异。基线模拟中,后者占梯度提升规范估计误差方差的97.6%。面板内重采样程序仅使用一条已实现轨迹的信息,无法识别这一跨设计成分。
意义:对开发者/AI行业的意义:强调在数据生成过程中创造独立识别变异的重要性,而非仅依赖重采样,对模型评估和不确定性量化有指导意义。
- 论文公开站arXiv
基于智能体方法的活动数据收集、出行行为建模与天气敏感需求预测
An Agentic Approach for Active Data Collection, Travel Behavior Modeling, and Weather-Sensitive Demand Prediction
摘要显示,本研究提出一个三智能体工作流,整合对话式数据收集、结构化数据处理和行为预测。通过聊天机器人管理的图像增强陈述偏好调查,收集了454条学生通勤者在五种天气情景下的出行方式选择数据。使用多项逻辑模型分析天气关联,并以逻辑回归和随机森林作为机器学习基准。评估了九个本地部署的大语言模型,范围从2亿到350亿参数,在四种零样本提示条件下,并扩展了角色、少样本和视觉配置。最佳文本零样本LLM达到69.9%的准确率,而最佳视觉配置达到71.…
意义:该研究展示了大语言模型在出行行为预测中的潜力,并比较了不同提示策略的效果,为开发天气敏感的智能出行服务提供了新思路。