- 论文公开站arXiv
LBA-CBF: Rapidly Adaptive Safety Filters via Parallel Dynamics Inference
Control barrier functions (CBFs) certify commands through an assumed dynamics model, so an abrupt, unmeasured regime change can undermine the certificate exactly when safety matters most. We present Look-Back Adaptive Co…
- 论文公开站arXiv
AdvSim2Real : Training Web Agents Against Adaptive Prompt Injection in a Web World Model
Web agents complete user requests by reading and acting on pages that third parties write, so an instruction planted on a page can redirect the agent away from the user's goal. The agent cannot simply ignore the page, be…
- 论文公开站arXiv
Paradee: Distilling Kokoro-82M into an 8M-Parameter Single-Voice Text-to-Speech Model
We distill Kokoro-82M, a widely used open text-to-speech model with 54 voices, into Paradee, an 8.07M-parameter model that speaks one of them. Paradee keeps Kokoro's architecture with much narrower layers, and each of it…
- 论文公开站arXiv
Private online learning and prediction for Littlestone classes
We study mistake bounds for differentially private online learning and online prediction under oblivious realisable adversaries. Online learning requires the learner to release a hypothesis at each time step whereas in o…
- 论文公开站arXiv
Cogentic:面向自动证明发现的多智能体编排
Cogentic: Multi-Agent Orchestration for Automated Proof Discovery
提出 Cogentic,一个用于开放研究问题自动证明发现的多智能体框架。前沿语言模型虽能单次生成优质数学想法,但面对需多路径探索的开放问题,单次生成往往不足。
- 论文公开站arXiv
WorldAuditBench:多模态智能体的交互式3D世界审计
WorldAuditBench: Interactive 3D World Auditing with Multimodal Agents
随着交互式3D世界被广泛用于研究智能行为,识别其中异常(如悬浮物体、可穿墙、与环境不一致的物体)的高效流程变得重要,本文提出相应基准。
- 论文公开站arXiv
PDMD:面向视频扩散模型的投影分布匹配蒸馏
PDMD: Projected Distribution Matching Distillation for Video Diffusion Models
现代视频扩散模型需在长时空Token序列上进行数十次去噪评估,分布匹配蒸馏(DMD)可将函数评估次数降至几次,但DMD样本在训练中会退化。
- 论文公开站arXiv
Kafila:在可信异构消费级机器集合上服务大语言模型
Kafila: Serving Large Language Models on a Trusted Set of Heterogeneous Commodity Machines
研究组成员或朋友圈各自拥有几台消费级计算机,但单台都不足以运行一个有能力的大语言模型。现有系统在开放集群中汇聚此类算力,而仅接纳可信机器的群体则无法使用。
- 论文公开站arXiv
适应AI:小学教师如何调整教学实践以融入AI课程
Adapting for AI: How elementary teachers adjust their practices for an AI-integrated curriculum
摘要显示,该研究追踪三名小学教师在为期13天、三周夏令营中实施围绕ToyTalk会话AI玩具开发平台构建的AI素养与英语语言艺术课程。基于每日个人反思、小组反思及营后访谈,研究发现教师的修复、差异化、翻译与平衡等适应性实践处于技术、学习者与教学三重张力交汇处,且教师对AI及自身角色的理解随营期经历演变。研究据此提出在小学课堂部署会话AI的设计启示与考量。
意义:为教育AI产品设计者与课程开发者提供一线教师适应性实践的实证依据,有助于让会话AI工具更贴合小学课堂真实教学情境。
- 论文公开站arXiv
生成、跟踪、改进:基于RL微调运动生成器的感知型多技能人形机器人运动
Generate, Track, Improve: Perceptive Multi-Skill Humanoid Locomotion with RL-Fine-Tuned Motion Generators
摘要显示,该工作提出双层运动架构:感知式流匹配运动生成器从原始深度图规划全身轨迹,控制引导强化学习训练的感知跟踪策略执行动作。核心贡献是一种离策略强化学习微调循环,通过结构化搜索采集数据并进行优势加权回归,提升生成器在未见地形与技能组合上的一致性。摘要称地形通过成功率最高提升25个百分点,技能选择提升80个百分点;使用原始深度图无需里程计或高度图,单对策略即可驱动Unitree G1完成走、跑、站立与跳跃等动作。
意义:为开发者提供一种样本高效的离策略微调范式,使多技能人形机器人仅凭深度图即可适应复杂地形,降低感知与部署门槛。
- 论文公开站arXiv
交换多重态框架中的交错磁性与广义张量性质
Altermagnetism and generalised tensorial properties in the exchange multiplet framework
摘要显示,该工作基于 Bertaut–Izyumov 交换多重态形式,提出一个用于计算磁性材料时间反演奇张量性质的表示论框架。与依赖不同磁点群或自旋群的方法不同,该框架将序参量视为连续变量。对于恒定磁矩共线结构,协变性对 Landau–Lifshitz 展开中的张量交织子施加简单对称约束,得到可分解磁性与晶体学部分的规范形式,并自动恢复磁点群选择定则,同时分离共旋与非共旋贡献。
意义:为交错磁体与反铁磁体的张量性质计算提供连续序参量框架,便于第一性原理与实验对接。
- 论文公开站arXiv
我该加入哪里?语言引导目标预测的机器人群体加入
Where Should I Join? Robot Group Joining via Language-Guided Goal Prediction
摘要显示,社交导航通常假设目标已给定,而机器人加入群体需根据群体实时活动与队形预测加入位置。该工作提出语言引导的机器人群体加入任务:给定观测与目标群体的自然语言描述,机器人识别相关成员并预测符合社交规范的加入位姿。方法通过递归谱划分生成结构化候选子集,用语言条件图像-几何模型排序,再以人类队形先验生成多模态能量-朝向图。在对话、排队、观众场景中取得竞争性定位精度与亚秒级推理,加入位姿预测优于所有基线,并在真实机器人上验证。
意义:为社交导航引入语言引导的群体加入能力,对导盲机器人、自主代步车等需要理解人群语义与队形的应用有直接价值。
- 论文公开站arXiv
FleXray:通用临床X射线分割
FleXray: Universal Clinical X-ray Segmentation
摘要显示,X光因三维解剖被压缩为二维投影、结构重叠且边界模糊,导致通用分割标注数据难以构建。作者提出FleXray,利用已有3D全身CT分割数据集与生成式图像编辑模型构建基于物理的生成式X光数据引擎,合成带完整标注的二维X光。模型在未见研究数据集与真实临床X光上可分割60种解剖结构,并支持疾病分级测量、X光引导介入导航与病理目标的数据高效学习。
意义:为X光提供通用全身分割能力,降低对人工标注的依赖,可推动医学影像定量分析与AI辅助介入应用。
- 论文公开站arXiv
类型安全不等于无错误:约束决策头遵循选项名而非绑定规则
Type-Safe Is Not Error-Free: A Constrained Decision Head Follows the Option Name, Not the Rubric Bound to It
摘要显示,该研究考察了Jev及两个类似的开源权重模型在仅改变选项名称与评分标准对应关系时的表现。在1200个工作流决策中,将选项从0/1重命名为no/yes后,每百次回答多出70.4次变化,AUC从0.94降至0.23,表明决策排序出现系统性反转。该效应在全部4个谓词上均成立,且随选项数量增加而增强,并受读出几何影响。
意义:提醒开发者:类型安全的结构化输出并不保证模型正确理解选项语义,选项命名可能显著影响决策可靠性。
- 论文公开站arXiv
A2M:MCP生态中基于轨迹优化的智能体劫持
A2M: Trace-Optimized Agent Hijacking in the MCP Ecosystem
摘要显示,使用MCP协议的智能体依赖语义匹配从第三方服务器选择工具,攻击者可通过控制元数据与输出实施语义供应链攻击。作者提出A2M两阶段黑盒框架:Attraction阶段优化工具元数据以提高调用概率,Manipulation阶段利用执行轨迹精炼对抗性工具返回,引导智能体产生攻击者期望结果。在LiveMCPBench上,针对GLM-4.6优化的直接攻击在四个场景中恶意工具调用率达93.6%,认知拒绝服务下加权token成本升至基线32.4…
意义:揭示MCP工具选择机制的供应链风险,提醒开发者在工具审核与运行时隔离上加强防护。
- 论文公开站arXiv
DolphinBench:绘制智能体记忆的帕累托前沿
DolphinBench: Mapping the Pareto Frontier of Agent Memory
摘要显示,现有记忆基准多采用对话问答形式,问题本身已暗示需检索的事实,且仅以准确率评分,允许系统以不合理成本与时间换取高分。DolphinBench 改为通过智能体任务完成度直接评估记忆,包含三种知识工作角色,每角色约 50 万 token 用户消息,每个角色 200 项任务均经有/无相关历史对照验证,并要求同时报告总成本与延迟。
意义:为智能体记忆系统提供兼顾准确率、成本与延迟的评测基准,有助于避免以不合理开销刷分的记忆方案。
- 论文公开站arXiv
Gricea:面向对话式AI研究的开放科学平台
Gricea: An Open Science Platform for Conversational AI Research
摘要显示,对话式 AI(CAI)研究缺乏统一的系统与实验配置报告方式,阻碍复现与知识积累。作者提出 Gricea,一个将研究表示为可配置、可部署研究制品的开放科学平台,整合研究流程、被试界面与对话任务行为。在一项复现研究中,Gricea 复现了 CUI 2026 中 93% 符合条件的论文配置,同时指出 96% 论文存在阻碍忠实复现的信息缺失。用户研究显示不同背景研究者可成功构建可运行研究。
意义:为对话式 AI 研究提供可复现、可共享的实验基础设施,有助于缓解复现危机并推动累积式知识构建。
- 论文公开站arXiv
LLM助手的可验证社会推理
Verifiable Social Reasoning for LLM Assistants
摘要显示,针对LLM助手在社交咨询场景中难以评测的问题,研究者提出Fuse多智能体仿真框架:目标智能体带有隐藏动机,与包括用户代表的智能体互动,用户再向被评测助手咨询以推断该动机,从而天然构造可验证的真实标签。研究用2.4万条标注的人类研究验证仿真保真度,并在12个LLM上实验,发现用户中介会加剧社会推理难度、模型对用户有偏框架存在系统性敏感、模型有时需要比人类更多的细节才能做出正确预测,且更长对话不总能提升表现。作者开源Fuse及含2…
意义:为LLM社交推理提供可验证评测基准与开源数据集,揭示用户中介与偏见框架对模型判断的系统性影响,利于助手安全性评估。
- 论文公开站arXiv
EG-ARSA:面向低资源场景的视觉道路安全审计开放专家模型
EG-ARSA: An Expert-Grounded Open Model for Visual Road Safety Auditing in Low-Resource Settings
该研究提出专家接地蒸馏(EGD)框架,将机构道路安全专业知识迁移至紧凑视觉语言模型,用于可扩展的视觉道路安全审计。通过量化校准阶段,教师模型与权威实地审计达成显著一致(Cohen's kappa=0.74)。蒸馏后的80亿参数学生模型采用低秩适应。研究还发布了首个开放专家接地的孟加拉道路安全审计数据集BD-ARSA,含21,947条图像审计记录,以及首个专为此任务开发的视觉语言模型EG-ARSA。实验显示,接地微调显著提升了序数风险评估…
意义:为低资源环境提供可扩展的视觉道路安全审计方案,通过专家接地蒸馏提升模型可靠性,对AI在公共安全领域的落地具有示范意义。
- 论文公开站arXiv
基于智能体方法的活动数据收集、出行行为建模与天气敏感需求预测
An Agentic Approach for Active Data Collection, Travel Behavior Modeling, and Weather-Sensitive Demand Prediction
摘要显示,本研究提出一个三智能体工作流,整合对话式数据收集、结构化数据处理和行为预测。通过聊天机器人管理的图像增强陈述偏好调查,收集了454条学生通勤者在五种天气情景下的出行方式选择数据。使用多项逻辑模型分析天气关联,并以逻辑回归和随机森林作为机器学习基准。评估了九个本地部署的大语言模型,范围从2亿到350亿参数,在四种零样本提示条件下,并扩展了角色、少样本和视觉配置。最佳文本零样本LLM达到69.9%的准确率,而最佳视觉配置达到71.…
意义:该研究展示了大语言模型在出行行为预测中的潜力,并比较了不同提示策略的效果,为开发天气敏感的智能出行服务提供了新思路。