- 论文公开站arXiv
LiMA:通过异步扩散桥接长期想象与实时灵巧操作
LiMA: Bridging Long-term Imagination to Real-time Dexterous Manipulation via Asynchronous Diffusion
摘要显示,LiMA 是一种异步双系统生成框架,将意图规划与反应式执行解耦:慢系统负责稀疏的长时程时空意图生成,快系统负责稠密高频动作精修,并通过 Latent Schrödinger Bridge Coupling 机制对齐稀疏意图与稠密轨迹。论文称其相较 Cosmos-Policy 降低 45.8% 推理延迟,在六项双臂灵巧操作任务上总体成功率 70.8%、子任务平均成功率 78.9%,并在未见场景中保持性能。
意义:为 VLA 与 World-Action Model 的推理延迟与反应速度矛盾提供异步分层思路,对实时机器人操作与具身智能系统架构有参考价值。
- 论文公开站arXiv
最小范数单变量双层ReLU分类:带跳跃连接的精确解与全局最优性
Minimal-Norm Univariate Two-Layer ReLU Classification: Exact Solutions and Global Optimality with Skip Connections
摘要研究单变量两层ReLU网络二分类的最小范数插值与ℓ2正则逻辑损失最小化,给出函数空间中最优分类器的完整几何刻画,并区分隐层偏置是否计入参数范数两种情形。摘要显示,偏置不受罚时最小范数插值器为贴合每次标签切换的分段仿射函数;偏置受罚时函数空间解唯一,每个同类标签段内恰有一个折点,构成最稀疏正间隔分类器。加入自由仿射跳跃连接不改变函数空间解,但使约束问题的每个KKT点全局最优。
意义:为理解浅层ReLU网络的隐层偏置与跳跃连接如何影响优化景观和稀疏性提供精确理论刻画,对网络设计与正则化选择有参考价值。
- 论文公开站arXiv
数学推理中顺序不变的答案与顺序敏感的表示
Order-Invariant Answers, Order-Sensitive Representations in Mathematical Reasoning
摘要显示,研究用合成多步函数复合任务测试16个1B至8B参数语言模型,在语义相同但规则顺序不同的题目下测量准确率与置换信噪比(SNR)。结果显示,能更准确解答重排问题的模型,其内部表征对不同规则顺序的区分度更高;层平均置换SNR与准确率在所有测试设置中均呈正秩相关,Spearman相关系数最高达0.86。研究据此提出应区分答案不变性与表征不变性。
意义:提示开发者:模型答案正确不等于内部表征对顺序不敏感,评估数学推理时需关注表征层面的顺序敏感性。
- 论文公开站arXiv
三角超固体2H-AgNiO2相变诱导磁矩的角度调制
Angular Modulations in Magnetic Torque Induced by Phase Transitions in the Triangular Supersolid $2H$-AgNiO$_2$
摘要显示,研究对易轴阻挫三角晶格反铁磁体2H-AgNiO2单晶在最高45T静磁场下进行了角分辨与场依赖磁矩测量。在首个超固态相附近观察到锯齿状角向信号,而在奈尔温度附近出现意外调制;场依赖测量显示四个场诱导异常随场取向演变。结合平均场与蒙特卡洛计算,作者构建了不同温度下的极坐标相图,认为角向依赖可由场旋转穿越不同相边界解释,实验与理论相图存在定性相似性。
意义:为阻挫磁体中超固态相与场诱导相变研究提供角向转矩实验与理论相图对照,有助于理解量子磁性材料中的多相竞争。
- 论文公开站arXiv
FeSe1-xSx向列相中场诱导的初期自旋密度相
Field-induced incipient spin-density phase stabilized inside the nematic phase of FeSe$_{1-x}$S$_x$
摘要显示,铁硫族超导体 FeSe$_{1-x}$S$_x$ 此前仅在加压下观测到自旋密度波(SDW)序。本研究在最高 68 T 磁场中,于其向列相内发现初生 SDW 相证据:超导被抑制后纵向电阻率出现陡升,并伴随隧道二极管振荡器频率响应与力矩各向异性异常;主导的低频量子振荡揭示出小的重构费米面,与磁场诱导 SDW 序一致。与加压调谐的同类样品 FeSe$_{0.96}$S$_{0.04}$ 对比表明,化学替代与加压均可在向列相内稳定 S…
意义:为铁基超导中向列涨落、SDW 序与超导配对竞争关系提供高场实验证据,有助于理解非常规超导配对机制。
- 论文公开站arXiv
排斥自注意力的非平衡相:混沌、注意力凝聚与涌现局域性
Nonequilibrium Phases of Repulsive Self-Attention: Chaos, Attention Condensation, and Emergent Locality
摘要研究了一个极简循环 Transformer 的非平衡动力学:N 个归一化 token,Q=K=I,值映射为负 V=-I。相似度注意力选择邻近表示,而负值映射将 token 推离被选场,形成反馈。d=2 时 token 位于圆上,正多边形为精确不动点;随注意力反馈强度 γ 增大,多边形经翻转分岔失稳,出现周期二运动、混沌及簇交换/翻转态。有限 β 下注意力随 N→∞ 仍弥散,凝聚出现在 β~N² 尺度;硬路由极限下出现表示空间的蝴蝶锥…
意义:为理解注意力机制的非平衡动力学提供极简可解析模型,揭示混沌、凝聚与局域化相变,启发对 Transformer 表达与稳定性的理论分析。
- 论文公开站arXiv
LLM能推理运行时行为吗?仓库级动态基准
Can LLMs Reason About Runtime Behavior? A Repository-Level Dynamic Benchmark
摘要显示,现有仓库级问答基准多评估静态代码理解且依赖LLM评判,执行推理基准则局限于代码片段或函数。作者提出SWE-Flux,包含来自12个真实Python仓库的480个执行推理实例,答案由插桩测试执行自动采集而非人工编写或LLM判定,覆盖控制流、循环、程序状态、数据流、异常与不变量。评估五个LLM显示该任务仍具挑战,最佳模型准确率仅37%,模型在局部行为上表现较好,但在数据流、跨过程执行、精确状态推理与套件级聚合上表现较差。
意义:为LLM代码执行推理提供可自动生成、避免LLM评判偏差的仓库级评测,揭示当前模型在动态行为理解上的明显短板。
- 论文公开站arXiv
交换多重态框架中的交错磁性与广义张量性质
Altermagnetism and generalised tensorial properties in the exchange multiplet framework
摘要显示,该工作基于 Bertaut–Izyumov 交换多重态形式,提出一个用于计算磁性材料时间反演奇张量性质的表示论框架。与依赖不同磁点群或自旋群的方法不同,该框架将序参量视为连续变量。对于恒定磁矩共线结构,协变性对 Landau–Lifshitz 展开中的张量交织子施加简单对称约束,得到可分解磁性与晶体学部分的规范形式,并自动恢复磁点群选择定则,同时分离共旋与非共旋贡献。
意义:为交错磁体与反铁磁体的张量性质计算提供连续序参量框架,便于第一性原理与实验对接。
- 论文公开站arXiv
转导学习的更锐界及其应用
Even Sharper Bounds for Transductive Learning and Its Applications
摘要显示,该论文提出 Sharper Transductive Local Complexity(STLC)方法,用于无放回均匀采样下的转导学习。其构造基于测试-训练经验过程上确界的 Bernstein 型集中不等式,证明使用 swap walk 的修正 log-Sobolev 不等式与双参数熵闭合。通过剥离论证与替代定位泛函,得到与经典归纳局部 Rademacher 复杂度界具有相同不动点与置信项的过量风险界,且去掉了早期转导结果中额…
意义:为转导学习提供更紧的泛化界,去掉对数置信因子,对少样本与核方法场景的理论分析与算法设计有参考价值。
- 论文公开站arXiv
我该加入哪里?语言引导目标预测的机器人群体加入
Where Should I Join? Robot Group Joining via Language-Guided Goal Prediction
摘要显示,社交导航通常假设目标已给定,而机器人加入群体需根据群体实时活动与队形预测加入位置。该工作提出语言引导的机器人群体加入任务:给定观测与目标群体的自然语言描述,机器人识别相关成员并预测符合社交规范的加入位姿。方法通过递归谱划分生成结构化候选子集,用语言条件图像-几何模型排序,再以人类队形先验生成多模态能量-朝向图。在对话、排队、观众场景中取得竞争性定位精度与亚秒级推理,加入位姿预测优于所有基线,并在真实机器人上验证。
意义:为社交导航引入语言引导的群体加入能力,对导盲机器人、自主代步车等需要理解人群语义与队形的应用有直接价值。
- 论文公开站arXiv
多量子阱二维钙钛矿的快中子闪烁
Fast-Neutron Scintillation with Multi-Quantum-Well 2D Perovskites
摘要显示,研究者提出一种层状二维铅卤钙钛矿闪烁体的合成策略,可独立调控宏观探测器几何与微观相组成,制备出毫米级厚度、大面积的多量子阱结构闪烁体,在保持纳秒级发光动力学的同时实现有效光谱分离。该闪烁体在137Cs 662 keV辐照下能量分辨率为5.4%,并在氘-氘聚变中子辐照下通过脉冲形状甄别实现中子与γ射线事件分离,品质因数达3.51。
意义:为快中子探测提供可扩展的二维钙钛矿材料平台,兼具纳秒响应与中子/γ甄别能力,对核安全与辐射探测硬件开发有参考价值。
- 论文公开站arXiv
StudentBench:AI与人类辅导产生等效GRE学习增益
StudentBench: AI and human tutoring yield equivalent GRE learning gains
摘要显示,研究者发布StudentBench评测套件与公开平台,收集超17.5万条学生-AI对话,并在2383名参与者中比较AI辅导、人类辅导与无辅导对GRE语文与数学成绩的影响。结果显示AI辅导与专家人类辅导的学习增益在统计上等效(p=.015),七个GRE领域中五个领域最佳AI导师平均超过人类导师;另有一项AI导师以低918倍成本达到等效增益。
意义:该研究为AI辅导效果提供大规模实证,表明低成本AI导师可能在某些场景替代人类辅导,对教育AI产品与模型评测有参考价值。
- 论文公开站arXiv
作者验证的对比学习
Contrastive Learning for Authorship Verification
摘要显示,在测试设定下对比学习方法在作者身份验证任务上优于基于分类的方法。研究识别出损失函数、批量大小、训练时长、预训练模型、输入上下文长度及随机文本片段数据增强为影响模型性能的关键因素,并据此构建了ModernBERT双编码器模型,在PAN21作者身份验证任务上取得98.4%的准确率。
意义:为文本作者归属与AI生成内容溯源提供高精度基线,双编码器+对比学习范式可迁移至其他文本匹配任务。
- 论文公开站arXiv
高维潜变量的可扩散性
On the Diffusibility of High-Dimensional Latents
摘要显示,表征自编码器(RAEs)让扩散模型能在预训练视觉编码器的特征空间中工作,但现成编码器为重建微调后会降低表征的有效维度。作者指出,在这种高维空间中使用流匹配的标准速度预测,会迫使模型拟合低维信号流形之外的正交噪声方向,导致优化低效;因此改用干净数据参数化(x0 预测),让学习聚焦于信号流形。多组强重建编码器实验显示,x0 预测一致提升文生图生成性能。
意义:为在预训练编码器潜空间上做扩散/流匹配的开发者提供参数化选择依据:x0 预测可能比速度预测更高效、生成质量更好。
- 论文公开站arXiv
基于 β 积分局部深度与自适应分组的自动深度局部中心聚类
Automatic depth-based local center clustering via $β$-integrated local depth and adaptive grouping
摘要显示,该研究提出全数据驱动的自动深度局部中心聚类方法 A-DLCC,无需用户指定簇数或邻域大小等数值参数。方法利用 β-积分局部深度识别在多个局部层级上持续居中的稳定样本点作为局部中心,并按代表性排序;每个局部中心诱导一个相似点群,群体相似度由所提出的非参数群级局部相似性度量。合并过程借鉴图论瓶颈路径思想,设计单一凝聚规则,自动估计簇数并决定何时停止合并。合成与真实数据实验显示其可产生可解释的聚类结果且无需调参。
意义:免调参的自动聚类对无监督学习与数据分析流程有实用价值,可降低模型选择成本。
- 论文公开站arXiv
基于 LLM 的代码漏洞修复中的指标失效:实证研究与变更感知筛选
Metrics Failure in LLM-Based Code Vulnerability Repair: An Empirical Study and a Change-Aware Screen
摘要显示,作者通过五项对照实验(203个Big-Vul漏洞函数、三个开源代码LLM、三种提示策略)论证编译率在单函数漏洞修复评估中不可靠:约64%的编译失败与模型无关,同一补丁在单个编译器标准标志下编译率波动1.8至2.7倍,且与参考相似度指标给出的模型排序相反;作为优化目标还会奖励删除与占位符式非修复。整函数CodeBLEU同样失效,连未修改的漏洞输入也得分高于所有模型。作者另考察仅对编辑区域打分的diff_F1变更感知筛选方法。
意义:提醒开发者与研究者:以编译率或整函数相似度衡量LLM漏洞修复会得出误导性结论,评估应关注实际修改区域。
- 论文公开站arXiv
EquivSVA:跨等价 RTL 实现的行为断言形式化验证数据集
EquivSVA: A Formally Verified Dataset of Behavioral Assertions Across Equivalent RTL Implementations
摘要显示,EquivSVA 是一个围绕行为族组织的形式化验证数据集,每个族包含同一外部可观察行为的四个结构不同 RTL 实现、共享接口级金标准属性、三个受控变异体及形式验证证据。数据集涵盖 12 个类别、120 个行为族、480 个参考 RTL 实现、914 个金标准属性和 360 个变异体,每个族均通过固定 17 项验证套件,并提供了族安全的训练、开发与测试划分。
意义:为 LLM 生成 SystemVerilog 断言提供行为级评测基准,可检验断言是否捕捉外部可观察行为而非实现细节,推动形式化验证与代码生成研究。
- 论文公开站arXiv
利用单一传感单元测量历史进行非定常流中的水下导航
Underwater Navigation in Unsteady Flows Using Measurement Histories from a Single Sensing Unit
摘要显示,研究提出一种因果观测器,仅凭单一传感单元的历史测量估计侧向流速,为固定导航控制器提供输入。在二维尾流仿真中,该虚拟传感接口将同步流场采样点从三个减少到机器人中心。仅在 Re=100 圆柱尾流上训练,未重新训练即在 Re=205 和 240 上分别达到 84.4% 和 80.6% 成功率,低于直接空间感知 7.4 和 4.6 个百分点,但显著优于仅当前流速观测器。
意义:为水下机器人减少传感器数量、降低布局约束提供思路,并验证单点流场历史在闭环控制中的可用性。
- 论文公开站arXiv
FleXray:通用临床X射线分割
FleXray: Universal Clinical X-ray Segmentation
摘要显示,X光因三维解剖被压缩为二维投影、结构重叠且边界模糊,导致通用分割标注数据难以构建。作者提出FleXray,利用已有3D全身CT分割数据集与生成式图像编辑模型构建基于物理的生成式X光数据引擎,合成带完整标注的二维X光。模型在未见研究数据集与真实临床X光上可分割60种解剖结构,并支持疾病分级测量、X光引导介入导航与病理目标的数据高效学习。
意义:为X光提供通用全身分割能力,降低对人工标注的依赖,可推动医学影像定量分析与AI辅助介入应用。
- 论文公开站arXiv
类型安全不等于无错误:约束决策头遵循选项名而非绑定规则
Type-Safe Is Not Error-Free: A Constrained Decision Head Follows the Option Name, Not the Rubric Bound to It
摘要显示,该研究考察了Jev及两个类似的开源权重模型在仅改变选项名称与评分标准对应关系时的表现。在1200个工作流决策中,将选项从0/1重命名为no/yes后,每百次回答多出70.4次变化,AUC从0.94降至0.23,表明决策排序出现系统性反转。该效应在全部4个谓词上均成立,且随选项数量增加而增强,并受读出几何影响。
意义:提醒开发者:类型安全的结构化输出并不保证模型正确理解选项语义,选项命名可能显著影响决策可靠性。
- 论文公开站arXiv
扩展执行框架而非上下文:从无策略脚手架到可复用专家智能体
Grow the Harness, Not the Context: From Strategy-Free Scaffolds to Reusable Specialist Agents
摘要显示,该研究提出 Growing Harness 训练范式,从仅暴露固定模型与工具接口、不含任务求解控制器的无策略脚手架出发,利用函数级执行轨迹将失败定位到有限代码范围,由优化器联合修复一组失败,并以成功优先的留出集门控回滚有害修改,使控制结构从任务反馈中逐步涌现。在 BrowseComp-Plus 与 WebArena-Verified 及 4B 至 120B 三种模型上,六种设置中五种平均成功率最高,第六种落后最优 0.7 个百…
意义:该工作把智能体控制逻辑沉淀为可复用代码而非反复填充上下文,显著降低调用次数与推理成本,并为小模型补齐长程任务能力提供新思路。
- 论文公开站arXiv
A2M:MCP生态中基于轨迹优化的智能体劫持
A2M: Trace-Optimized Agent Hijacking in the MCP Ecosystem
摘要显示,使用MCP协议的智能体依赖语义匹配从第三方服务器选择工具,攻击者可通过控制元数据与输出实施语义供应链攻击。作者提出A2M两阶段黑盒框架:Attraction阶段优化工具元数据以提高调用概率,Manipulation阶段利用执行轨迹精炼对抗性工具返回,引导智能体产生攻击者期望结果。在LiveMCPBench上,针对GLM-4.6优化的直接攻击在四个场景中恶意工具调用率达93.6%,认知拒绝服务下加权token成本升至基线32.4…
意义:揭示MCP工具选择机制的供应链风险,提醒开发者在工具审核与运行时隔离上加强防护。
- 论文公开站arXiv
TM-APR:基于解析在线自适应的热成像时序记忆定位
TM-APR: Thermal Temporal-Memory Localization via Analytic Online Adaptation
摘要显示,该工作针对热成像视觉位置识别(Thermal VPR)在在线部署中面临的环境依赖强、在线重训练开销大、难以建模非线性漂移等问题,首次将解析类增量学习(ACIL)与域不变VPR结合,发现其无梯度矩阵更新可构成强基线,并进一步利用ACIL与现代控制理论的代数等价性,将无迹传播、高斯混合划分与极小极大H∞优化嵌入更新回路,实现O(1)复杂度的闭式矩阵更新,使在线学习延迟低于传感器采样间隔,从而避免实时SLAM轨迹跳变。
意义:为热成像SLAM/VPR在线部署提供免反向传播、低延迟的域自适应更新思路,对实时机器人与边缘AI有参考价值。
- 论文公开站arXiv
SWE-Serve:面向生产推理服务的智能体工程基准
SWE-Serve: Benchmarking Agentic Engineering For Production Inference Serving
摘要显示,SWE-Serve 是一个评估智能体完成生产级推理工程任务的基准,包含 53 个源自 SGLang 近期生产变更的仓库级任务,覆盖六大推理工程类别,任务在 CPU 或单张 H100 上执行,采用隐藏功能与回归测试、E2E 服务测试及性能门槛评估。在 11 个模型、31 种配置中,最佳配置平均 pass@1 为 75%,但在 19 个端到端任务中,约三分之一通过局部测试的补丁被服务级 E2E 测试拒绝,暴露出局部完成与生产正确性…
意义:该基准首次系统衡量智能体在生产推理服务中的端到端正确性,揭示局部通过率与真实部署要求之间的落差,为 AI 编码智能体的评估与改进提供更贴近生产的标尺。
- 论文公开站arXiv
CliffCompaction:面向长时程编码智能体的低成本压缩
CliffCompaction: Cost-Efficient Compaction for Long-Horizon Coding Agents
摘要显示,CliffCompaction 是一种自动压缩技术,在有限上下文窗口下可将成本降低最多 50%,同时在 Terminal-Bench 上保持或提升性能,并在 KernelBench 上取得领先结果。其核心在于压缩时只截断或丢弃内容,绝不改写重述,且每轮压缩只处理原始内容、丢弃旧压缩产物,以避免上下文漂移。摘要称其在 KernelBench 上 200 步后实现 2.23 倍、400 步后 3.58 倍的 CUDA 内核加速。
意义:为长周期编程智能体提供低成本上下文管理方案,使测试时扩展更经济,并开源 API 代理实现,便于开发者集成。