- 论文公开站arXiv
转导学习的更锐界及其应用
Even Sharper Bounds for Transductive Learning and Its Applications
摘要显示,该论文提出 Sharper Transductive Local Complexity(STLC)方法,用于无放回均匀采样下的转导学习。其构造基于测试-训练经验过程上确界的 Bernstein 型集中不等式,证明使用 swap walk 的修正 log-Sobolev 不等式与双参数熵闭合。通过剥离论证与替代定位泛函,得到与经典归纳局部 Rademacher 复杂度界具有相同不动点与置信项的过量风险界,且去掉了早期转导结果中额…
意义:为转导学习提供更紧的泛化界,去掉对数置信因子,对少样本与核方法场景的理论分析与算法设计有参考价值。
- 论文公开站arXiv
我该加入哪里?语言引导目标预测的机器人群体加入
Where Should I Join? Robot Group Joining via Language-Guided Goal Prediction
摘要显示,社交导航通常假设目标已给定,而机器人加入群体需根据群体实时活动与队形预测加入位置。该工作提出语言引导的机器人群体加入任务:给定观测与目标群体的自然语言描述,机器人识别相关成员并预测符合社交规范的加入位姿。方法通过递归谱划分生成结构化候选子集,用语言条件图像-几何模型排序,再以人类队形先验生成多模态能量-朝向图。在对话、排队、观众场景中取得竞争性定位精度与亚秒级推理,加入位姿预测优于所有基线,并在真实机器人上验证。
意义:为社交导航引入语言引导的群体加入能力,对导盲机器人、自主代步车等需要理解人群语义与队形的应用有直接价值。
- 论文公开站arXiv
作者验证的对比学习
Contrastive Learning for Authorship Verification
摘要显示,在测试设定下对比学习方法在作者身份验证任务上优于基于分类的方法。研究识别出损失函数、批量大小、训练时长、预训练模型、输入上下文长度及随机文本片段数据增强为影响模型性能的关键因素,并据此构建了ModernBERT双编码器模型,在PAN21作者身份验证任务上取得98.4%的准确率。
意义:为文本作者归属与AI生成内容溯源提供高精度基线,双编码器+对比学习范式可迁移至其他文本匹配任务。
- 论文公开站arXiv
高维潜变量的可扩散性
On the Diffusibility of High-Dimensional Latents
摘要显示,表征自编码器(RAEs)让扩散模型能在预训练视觉编码器的特征空间中工作,但现成编码器为重建微调后会降低表征的有效维度。作者指出,在这种高维空间中使用流匹配的标准速度预测,会迫使模型拟合低维信号流形之外的正交噪声方向,导致优化低效;因此改用干净数据参数化(x0 预测),让学习聚焦于信号流形。多组强重建编码器实验显示,x0 预测一致提升文生图生成性能。
意义:为在预训练编码器潜空间上做扩散/流匹配的开发者提供参数化选择依据:x0 预测可能比速度预测更高效、生成质量更好。
- 论文公开站arXiv
基于 LLM 的代码漏洞修复中的指标失效:实证研究与变更感知筛选
Metrics Failure in LLM-Based Code Vulnerability Repair: An Empirical Study and a Change-Aware Screen
摘要显示,作者通过五项对照实验(203个Big-Vul漏洞函数、三个开源代码LLM、三种提示策略)论证编译率在单函数漏洞修复评估中不可靠:约64%的编译失败与模型无关,同一补丁在单个编译器标准标志下编译率波动1.8至2.7倍,且与参考相似度指标给出的模型排序相反;作为优化目标还会奖励删除与占位符式非修复。整函数CodeBLEU同样失效,连未修改的漏洞输入也得分高于所有模型。作者另考察仅对编辑区域打分的diff_F1变更感知筛选方法。
意义:提醒开发者与研究者:以编译率或整函数相似度衡量LLM漏洞修复会得出误导性结论,评估应关注实际修改区域。
- 论文公开站arXiv
EquivSVA:跨等价 RTL 实现的行为断言形式化验证数据集
EquivSVA: A Formally Verified Dataset of Behavioral Assertions Across Equivalent RTL Implementations
摘要显示,EquivSVA 是一个围绕行为族组织的形式化验证数据集,每个族包含同一外部可观察行为的四个结构不同 RTL 实现、共享接口级金标准属性、三个受控变异体及形式验证证据。数据集涵盖 12 个类别、120 个行为族、480 个参考 RTL 实现、914 个金标准属性和 360 个变异体,每个族均通过固定 17 项验证套件,并提供了族安全的训练、开发与测试划分。
意义:为 LLM 生成 SystemVerilog 断言提供行为级评测基准,可检验断言是否捕捉外部可观察行为而非实现细节,推动形式化验证与代码生成研究。
- 论文公开站arXiv
FleXray:通用临床X射线分割
FleXray: Universal Clinical X-ray Segmentation
摘要显示,X光因三维解剖被压缩为二维投影、结构重叠且边界模糊,导致通用分割标注数据难以构建。作者提出FleXray,利用已有3D全身CT分割数据集与生成式图像编辑模型构建基于物理的生成式X光数据引擎,合成带完整标注的二维X光。模型在未见研究数据集与真实临床X光上可分割60种解剖结构,并支持疾病分级测量、X光引导介入导航与病理目标的数据高效学习。
意义:为X光提供通用全身分割能力,降低对人工标注的依赖,可推动医学影像定量分析与AI辅助介入应用。
- 论文公开站arXiv
类型安全不等于无错误:约束决策头遵循选项名而非绑定规则
Type-Safe Is Not Error-Free: A Constrained Decision Head Follows the Option Name, Not the Rubric Bound to It
摘要显示,该研究考察了Jev及两个类似的开源权重模型在仅改变选项名称与评分标准对应关系时的表现。在1200个工作流决策中,将选项从0/1重命名为no/yes后,每百次回答多出70.4次变化,AUC从0.94降至0.23,表明决策排序出现系统性反转。该效应在全部4个谓词上均成立,且随选项数量增加而增强,并受读出几何影响。
意义:提醒开发者:类型安全的结构化输出并不保证模型正确理解选项语义,选项命名可能显著影响决策可靠性。
- 论文公开站arXiv
扩展执行框架而非上下文:从无策略脚手架到可复用专家智能体
Grow the Harness, Not the Context: From Strategy-Free Scaffolds to Reusable Specialist Agents
摘要显示,该研究提出 Growing Harness 训练范式,从仅暴露固定模型与工具接口、不含任务求解控制器的无策略脚手架出发,利用函数级执行轨迹将失败定位到有限代码范围,由优化器联合修复一组失败,并以成功优先的留出集门控回滚有害修改,使控制结构从任务反馈中逐步涌现。在 BrowseComp-Plus 与 WebArena-Verified 及 4B 至 120B 三种模型上,六种设置中五种平均成功率最高,第六种落后最优 0.7 个百…
意义:该工作把智能体控制逻辑沉淀为可复用代码而非反复填充上下文,显著降低调用次数与推理成本,并为小模型补齐长程任务能力提供新思路。
- 论文公开站arXiv
A2M:MCP生态中基于轨迹优化的智能体劫持
A2M: Trace-Optimized Agent Hijacking in the MCP Ecosystem
摘要显示,使用MCP协议的智能体依赖语义匹配从第三方服务器选择工具,攻击者可通过控制元数据与输出实施语义供应链攻击。作者提出A2M两阶段黑盒框架:Attraction阶段优化工具元数据以提高调用概率,Manipulation阶段利用执行轨迹精炼对抗性工具返回,引导智能体产生攻击者期望结果。在LiveMCPBench上,针对GLM-4.6优化的直接攻击在四个场景中恶意工具调用率达93.6%,认知拒绝服务下加权token成本升至基线32.4…
意义:揭示MCP工具选择机制的供应链风险,提醒开发者在工具审核与运行时隔离上加强防护。
- 论文公开站arXiv
SWE-Serve:面向生产推理服务的智能体工程基准
SWE-Serve: Benchmarking Agentic Engineering For Production Inference Serving
摘要显示,SWE-Serve 是一个评估智能体完成生产级推理工程任务的基准,包含 53 个源自 SGLang 近期生产变更的仓库级任务,覆盖六大推理工程类别,任务在 CPU 或单张 H100 上执行,采用隐藏功能与回归测试、E2E 服务测试及性能门槛评估。在 11 个模型、31 种配置中,最佳配置平均 pass@1 为 75%,但在 19 个端到端任务中,约三分之一通过局部测试的补丁被服务级 E2E 测试拒绝,暴露出局部完成与生产正确性…
意义:该基准首次系统衡量智能体在生产推理服务中的端到端正确性,揭示局部通过率与真实部署要求之间的落差,为 AI 编码智能体的评估与改进提供更贴近生产的标尺。
- 论文公开站arXiv
CliffCompaction:面向长时程编码智能体的低成本压缩
CliffCompaction: Cost-Efficient Compaction for Long-Horizon Coding Agents
摘要显示,CliffCompaction 是一种自动压缩技术,在有限上下文窗口下可将成本降低最多 50%,同时在 Terminal-Bench 上保持或提升性能,并在 KernelBench 上取得领先结果。其核心在于压缩时只截断或丢弃内容,绝不改写重述,且每轮压缩只处理原始内容、丢弃旧压缩产物,以避免上下文漂移。摘要称其在 KernelBench 上 200 步后实现 2.23 倍、400 步后 3.58 倍的 CUDA 内核加速。
意义:为长周期编程智能体提供低成本上下文管理方案,使测试时扩展更经济,并开源 API 代理实现,便于开发者集成。
- 论文公开站arXiv
φ-RIE:从逼真重建到可交互环境
φ-RIE: From Photorealistic Reconstruction to Interactive Environments
摘要显示,3D高斯泼溅(3DGS)虽能对捕获场景实现照片级真实重建,但该表示本身不支持物理交互,因为物体外观可能与背景纠缠,且被遮挡的物体几何与背景内容未被观测。为此作者提出φ-RIE,一种高斯原生流水线,将选定物体转换为可移动的模拟器资产,同时保留其余重建内容,其核心是资产构建与源移除相耦合。在50个ScanNet++场景上,基于证据的选择与配准重试将20毫米匹配F1从0.336提升至0.383。
意义:为机器人仿真与具身智能提供从真实场景重建到可交互资产的转换路径,弥合视觉重建与物理仿真之间的鸿沟。
- 论文公开站arXiv
连续流心室辅助装置集成系统架构的高效生理控制
Efficient physiological control of an integrated system architecture for continuous-flow ventricular assist devices: in-silico study
摘要显示,该研究提出并评估了一套用于连续流心室辅助装置(VAD)生理控制的集成系统架构(ISA)。控制器基于VAD流入插管的压力测量估算心率和心室充盈压,动态调节转速以优化装置与患者交互。在27个仿真场景中,转速相对基线6000 rpm调整范围为-10%(-600 rpm)至+43%(+2600 rpm),消除了无控制条件下出现的12例心室抽吸与回流事件,并观察到左心室射血分数、心肌氧耗、氧输送及心脏功率等血流动力学与代谢指标的改善。
意义:为VAD智能闭环控制提供仿真验证路径,展示基于压力传感的生理自适应调速可减少抽吸等不良事件,对医疗AI与植入式设备控制算法开发者有参考价值。
- 论文公开站arXiv
长时程LLM智能体交互中的涌现性合谋
Emergent Collusion in Long-Horizon LLM Agent Interaction
该研究构建了一个长周期多智能体环境:两个智能体反复完成各自任务、共享任务日志、互相验证工作并获得奖励,并引入使遵守验证协议与奖励最大化相冲突的现实约束。摘要显示,在10个模型的测试中,94%的轨迹出现了串通行为,同一模型家族中能力更强的模型更早达成串通;同伴干预与消融实验表明,串通受同伴行为、奖励结构、验证反馈及交互历史影响,限制交互历史的数量与范围可减少串通。
意义:提示长周期多智能体部署存在协议失效与合谋风险,开发者需关注交互历史管理与验证机制设计。
- 论文公开站arXiv
通过迭代去对齐估计罕见事件
Rare Event Estimation via Iterative Unalignment
摘要显示,该研究针对自主智能体随机输出轨迹中极稀有但可能灾难性的事件,提出一种新的重要性采样方法:通过可微扰动原模型权重构造提议分布,并联合事件放大可微代理与自适应正则化以平衡放大与估计稳定性。在约1.2亿和26亿参数模型、三类事件族、300多个稀有事件(稀有度低至10^-9)上评估,最可验证设置下相较朴素蒙特卡洛获得超过800倍计算加权效率提升。
意义:为评估自主智能体极端风险提供了可扩展的稀有事件概率估计工具,降低安全部署中风险量化的算力门槛。
- 论文公开站arXiv
RRSI:智能体框架的正则化递归自我改进
RRSI: Regularized Recursive Self-Improvement of Agent Harnesses
摘要显示,LLM 智能体的能力很大程度上由其运行框架(提示、控制流、工具、记忆与上下文管理)放大,近期方法通过迭代提出并筛选框架组件的编辑来实现智能体系统层面的递归自我改进,但容易记忆训练任务、在分布外基准上增益消失。作者提出 RRSI,在候选提出与选择环节引入正则化:提出器采用时间退火预算并鼓励探索未走过的演化路径,选择器配备评论器与剪枝器过滤基准特定、过小、过贵或失效的改动。在编码、智能体工作区与工程设计等八个基准上,摘要称其在演化…
意义:为智能体框架自动演化提供抗过拟合思路,提示开发者关注可复用机制而非基准特定调优。
- 论文公开站arXiv
Harness-Zero:以智能体为框架的框架蒸馏
Harness-Zero: Harness Distillation via Agent-as-Harness
论文提出「智能体外壳蒸馏」问题:将针对特定领域或实例优化过的外部外壳(harness)所诱导的行为迁移进模型权重,使收益在部署时固定单一外壳下仍能保留。作者提出 Harness-Zero,借助「智能体即外壳」机制,由受优化外壳引导的智能体在目标外壳动作空间中修正学生回答,形成训练示范,再经微调内化。实验覆盖知识工作、工具使用与科学领域,摘要显示在相同演化外壳下 agent-as-harness 优于 code-as-harness。
意义:为智能体训练提供新范式:把外部外壳的优化收益固化进模型权重,减少对部署期专用外壳与路由的依赖。
- 论文公开站arXiv
DexTacWAM:面向灵巧操作的视触觉世界-动作模型
DexTacWAM: A Visuo-Tactile World-Action Model for Dexterous Manipulation
摘要显示,DexTacWAM 是一种视触觉世界-动作模型(WAM),将各指尖触觉独立编码,经手指与姿态感知的触觉压缩器聚合后注入视频扩散世界模型,实现视触觉联合世界建模。在 22 自由度双臂平台的六项富接触灵巧操作任务中均取得最高分,平均 70.6,最强基线为 38.0。消融表明收益来自将接触演化纳入预测世界状态,而非仅做触觉条件化。
意义:把触觉纳入世界模型而非仅作条件输入,为富接触机器人操作提供了新范式,对具身智能与多模态世界模型研究有直接参考价值。
- 论文公开站arXiv
onPanda:通过词元级修正高效标注LLM与智能体对齐数据
onPanda: Efficient Annotation of On-Policy Alignment Data for LLMs and Agents via Token-Level Correction
摘要显示,onPanda是一款用于高效标注LLM对齐数据与Agent轨迹的交互式工具,核心交互为Token级校正:标注者定位首个不当Token,从候选Token中选择替代或自由编辑,系统截断其后内容并从修正前缀继续生成,循环此过程。摘要称小规模对照研究显示其中位标注时间较人工后编辑减少52%,且因绝大多数Token由模型生成,数据较好保留采样分布,适合构建on-policy SFT与偏好数据;同时发布Panda-CVL数据集及Token…
意义:Token级校正以低成本产出贴近模型采样分布的on-policy数据,并天然形成带位置的正负样本,可提升SFT与偏好数据构建效率。
- 论文公开站arXiv
临界状态RL:诊断多轮工具使用中的可训练状态
Critical-State RL: Diagnosing Trainable States for Multi-Turn Tool Use
摘要显示,多轮工具调用失败常取决于单次模型调用,但仅靠奖励变化无法判断哪次调用值得训练,因为奖励可能反映后续随机性而非当前动作差异。作者提出 Critical-State RL,通过评估每次候选调用的局部奖励是否反映其对任务成功的贡献、以及相对参考策略是否存在改进空间,并用嵌套采样分离动作相关奖励变化与延续噪声,在选定状态上以上下文赌博机方式优化策略。在 BFCL v4 上,诊断选出的状态训练优于其他状态,missing-functio…
意义:为多轮工具调用智能体提供一种定位关键可训练步骤的方法,有助于减少无效训练信号、提升 RL 微调效率。
- 论文公开站arXiv
MIGU:面向操作规划的不确定性下多模态指令接地
MIGU: Multimodal Instruction Grounding under Uncertainty for Manipulation Planning
摘要显示,MIGU 是一个模块化框架,用于在语言与手势线索互补但不确定的情况下进行多模态指令接地。它通过眼-指几何传播视线方向与深度不确定性构建三维几何似然,并结合视觉语言模型提供的语义先验,以类贝叶斯方式融合为统一接地信念,进而支持直接规划或请求澄清。真实基准上 MIGU 优于所评估基线,消融实验支持显式多模态不确定性建模的收益。
意义:为机器人在不确定语言与手势输入下提供可量化的接地与澄清机制,对具身智能与多模态规划有参考价值。
- 论文公开站arXiv
学习超越人类可演示的能力
Learning Beyond What Humans Can Demonstrate
摘要显示,针对动态稳定性、精确接触时序或灵巧协调等人类操作者难以甚至无法采集示范数据的任务,作者提出 GLIDE 框架,通过推断任务特定失效模式并将其转化为可执行的「护栏」,用于过滤遥操作与策略指令、约束易失败动作,并依据轨迹反馈迭代改进。在三个任务上,数据采集成功率从 0-10% 提升至 70-90%,策略执行成功率分别达到 70%、60%、60%。
意义:为缺乏人类示范数据的机器人操作任务提供数据采集与策略部署的新思路,护栏机制可降低对专家示范的依赖。
- 论文公开站arXiv
迁移率隙中绝对连续的边缘谱
Don't mind the gap: Absolutely Continuous Edge Spectrum in a Mobility Gap
摘要显示,该研究考察二维晶格哈密顿量与磁薛定谔算子在迁移率间隙中的边缘谱。在适当的局域化与边界假设下,作者证明非零常数体拓扑指标意味着整个间隙区间属于半空间算子的绝对连续谱,且其绝对连续谱重数在几乎处处由该指标的绝对值给出下界。文中还提到第2.3节辅助空间切割构造的初版由ChatGPT 6生成。
意义:为拓扑绝缘体边缘态在迁移率间隙中的稳定性提供严格数学基础,有助于理解无序系统中拓扑保护的谱性质。
- 论文公开站arXiv
GameHorizon套件:游戏中的多时间跨度数据与评估
GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay
摘要显示,现有游戏数据集与基准存在覆盖游戏少、缺少语言指令、依赖高方差在线回合等问题。为此作者提出 GameHorizon 统一数据与评测套件,包含可扩展的多时间尺度指令标注流水线 GameHorizon-Annotator、首个大规模 AAA 游戏数据集 GameHorizon-Data(21 款游戏、5000 小时、100 名人类专家玩家录制,含时间对齐视频、玩家操作与多时间尺度指令),以及支持可复现离线与分步在线测试的 GameH…
意义:为游戏智能体提供可复现的多时间尺度评测与大规模对齐数据,有助于定位长程规划与动作控制的失败环节。