- 论文公开站arXiv
Kafila:在可信异构消费级机器集合上服务大语言模型
Kafila: Serving Large Language Models on a Trusted Set of Heterogeneous Commodity Machines
研究组成员或朋友圈各自拥有几台消费级计算机,但单台都不足以运行一个有能力的大语言模型。现有系统在开放集群中汇聚此类算力,而仅接纳可信机器的群体则无法使用。
- 论文公开站arXiv
跳出框框:滑动窗口 KV 推理中的信息保留与传递
Thinking Outside the Box: Retention and Transmission of Information in Sliding-Window KV Inference
滑动窗口 KV 推理指增量处理序列,仅保留固定大小的近期键值状态缓存。它可在推理时应用于预训练因果 Transformer 而无需额外训练,同时其 KV 缓存内存保持固定。
- 论文公开站arXiv
信还是不信:语音中的检索增强事实核查
To Trust or Not to Trust: Retrieval-Augmented Fact Checking in Speech
摘要显示,研究者提出 VeriSpeak,一个用于研究大型音频语言模型(LALM)语音事实核查能力的探针基准,包含 3,879 条口语化声明,覆盖时间、地理与关系类事实,真假标签均衡。实验发现文本与语音之间存在稳定的模态差距:能可靠核查书面声明的模型在同样内容以语音呈现时常常失败;仅靠检索收益有限,因为模型常将检索证据与语音声明混淆,而检索结合显式推理可提升声明-证据比对效果,思维调优的 LALM 达到 86.1% 准确率。
意义:提示开发者:语音场景下事实核查不能简单复用文本能力,需重视跨模态差距与检索证据的显式推理比对。
- 论文公开站arXiv
RAPID:从演示中进行机器人智能体编程
RAPID: Robot Agentic Programming from Demonstrations
摘要显示,RAPID 面向机器人系统提出「从演示进行机器人智能体编程」方法,仅凭一次视觉人类演示,即可自动生成、验证并迭代优化机器人程序。其智能体循环依赖可测试任务规范、动作原语与可交互执行验证环境,三者均由演示自动推断。RAPID 采用以物体为中心的关系式程序表示,将动作原语表达为实现物体级运动效果的轨迹优化程序,并通过关系约束在运行时组合,从而提升跨物体位姿、形状、材质与环境的泛化能力。
意义:该方法把编码智能体的自动验证与迭代能力引入机器人编程,降低示教门槛,并为可复用、可泛化的机器人技能生成提供新范式。
- 论文公开站arXiv
排斥自注意力的非平衡相:混沌、注意力凝聚与涌现局域性
Nonequilibrium Phases of Repulsive Self-Attention: Chaos, Attention Condensation, and Emergent Locality
摘要研究了一个极简循环 Transformer 的非平衡动力学:N 个归一化 token,Q=K=I,值映射为负 V=-I。相似度注意力选择邻近表示,而负值映射将 token 推离被选场,形成反馈。d=2 时 token 位于圆上,正多边形为精确不动点;随注意力反馈强度 γ 增大,多边形经翻转分岔失稳,出现周期二运动、混沌及簇交换/翻转态。有限 β 下注意力随 N→∞ 仍弥散,凝聚出现在 β~N² 尺度;硬路由极限下出现表示空间的蝴蝶锥…
意义:为理解注意力机制的非平衡动力学提供极简可解析模型,揭示混沌、凝聚与局域化相变,启发对 Transformer 表达与稳定性的理论分析。
- 论文公开站arXiv
FleXray:通用临床X射线分割
FleXray: Universal Clinical X-ray Segmentation
摘要显示,X光因三维解剖被压缩为二维投影、结构重叠且边界模糊,导致通用分割标注数据难以构建。作者提出FleXray,利用已有3D全身CT分割数据集与生成式图像编辑模型构建基于物理的生成式X光数据引擎,合成带完整标注的二维X光。模型在未见研究数据集与真实临床X光上可分割60种解剖结构,并支持疾病分级测量、X光引导介入导航与病理目标的数据高效学习。
意义:为X光提供通用全身分割能力,降低对人工标注的依赖,可推动医学影像定量分析与AI辅助介入应用。
- 论文公开站arXiv
CodeMidas:从代码本身扩展智能体编码RL环境
CodeMidas: Scaling Agentic Coding RL Environments from Code Itself
摘要显示,现有编码智能体 RL 环境多依赖 issue、commit 等开发痕迹,任务来源受限。CodeMidas 提出一种智能体流水线,仅以源代码为任务专属输入,将代码库中已实现的功能转化为可执行 RL 环境,通过智能体探索形成行为规格、基于原始代码执行构建测试,并经执行校验与多次解轨迹筛选任务。其数据集含来自 3,185 个开源代码库的 5,545 个训练任务,覆盖 23 种语言与 15 个技术领域。
意义:为编码智能体 RL 训练提供低成本、可扩展的任务生成路径,降低对 issue/commit 等人工痕迹的依赖,利于开发者构建自有代码库训练环境。
- 论文公开站arXiv
嵌入模型以奇特方式度量
Embedding Models Measure in Peculiar Ways
摘要显示,该研究考察嵌入空间是否反映质量、距离、时间和体积等物理测量,而这些量本应具有唯一客观的语义等价与距离关系。结果发现,嵌入空间对物理测量的建模仅较弱,且呈现出相当奇特的度量模式;进一步分析表明,物理测量的嵌入表示受表层字符串相似性强烈影响,重新校准相似度也未显著改善对齐效果。
意义:提示嵌入模型的语义相似度可能被表层字符串特征主导,对需要数值与物理量推理的应用构成风险。
- 论文公开站arXiv
尖晶石铁氧体中长波长与短波长磁振子阻尼的差异
Divergence between long- and short-wavelength magnon damping in spinel ferrites
摘要显示,研究结合铁磁共振(FMR)与共振非弹性X射线散射,测量尖晶石铁氧体 Li0.5AlxFe2.5-xO4 中长波(q≈0)与短波(高q)磁振子。结果显示铝替代显著降低磁振子带宽并大幅缩短高q磁振子寿命,与FMR推断的超低阻尼形成鲜明对比,表明非磁性替代元素对长波与短波磁振子阻尼的影响并不一致。
意义:提示仅靠FMR评估的q≈0阻尼不足以预测高频磁振子器件性能,材料筛选需关注有限动量下的阻尼。
- 论文公开站arXiv
Affora:面向智能体友好界面的设计系统
Affora: A Design System for Agent-Friendly Interfaces
摘要显示,计算机使用智能体常需操作面向人类设计的软件,但界面往往无法向机器读者清晰传达操作或任务状态。作者提出 Affora 设计系统,旨在同时服务人类与智能体读者,并保留视觉自由度与熟悉的人机工作流。通过三项受控研究考察组件实现、视觉变化与交互设计原则,并给出从单个组件到完整站点的指南、可复用实现与可执行检查。评估显示,在 Affora 能弥补现有缺陷的独立界面上有提升,但在缺陷不存在或超出其覆盖范围时效果有限。
意义:为开发者提供兼顾人机双读者的界面设计规范与可执行检查,有助于降低智能体操作软件时的交互成本与歧义。
- 论文公开站arXiv
ENCP:用于视觉语言导航的回合归一化共形预测
ENCP: Episode-Normalized Conformal Prediction for Vision-and-Language Navigation
摘要显示,针对视觉语言导航(VLN)智能体需多步序贯决策、标准共形预测在校准中无法为依赖且变长的导航回合提供覆盖保证的问题,作者提出回合归一化共形预测(ENCP):用策略残差置信度重新缩放非一致性分数,并为每个回合校准一个最大分数。在可交换校准与测试回合假设下,该方法以至少 1-α 的概率覆盖每一步真值,同时允许回合内步骤间存在依赖。在 R2R 与 REVERIE 数据集上、四种 VLN 策略与三种非一致性分数下,ENCP 在已见到未见…
意义:为序贯决策智能体提供模型无关的不确定性估计与覆盖保证,可用于判断导航智能体何时应交由更强预测器或人类协助。
- 论文公开站arXiv
LLM何时应弃答?用于选择性风险控制的自问链
When Should LLMs Abstain? Chain-of-Self-Questioning for Selective Risk Control
摘要显示,论文提出仅靠提示词的 Chain-of-Self-Questioning(CoSQ)框架,让模型在明确评估回答问题所需信息后再决定是否作答。在 TruthfulQA 817 题多选题验证集上,用 11 个开源与托管模型家族测试 17 种条件:平衡选项协议下 Grounded-CoSQ(τ=0.90)将平均无条件错误作答率从思维链提示的 13.1% 降至 8.9%,相对下降 32.1%,作答准确率由 86.9% 升至 89.7%…
意义:为开发者提供无需训练、可调阈值的拒答机制,在高风险场景中以可控覆盖率降低无依据作答风险。
- 论文公开站arXiv
智能体社会需要社会性治理框架
Agentic Societies Need a Social Harness
摘要显示,论文提出"智能体社会"概念,指多个AI智能体代表不同主体、跨信任边界自主协作。实验表明,即便诚实且能力足够的智能体,在现有 harness 与消息原语下也常无法达成满意结果;而故障或恶意智能体可通过通信("speech")漏洞拖延协作、影响结果并追求有害目标。作者主张除管理私有上下文与委托人通信的"个人 harness"外,还需"社会性 harness",并提出分层架构,实现失败预防、运行时无效消息检测与事后追责。
意义:为多智能体系统提供跨信任边界的通信安全与追责设计思路,对构建可审计、抗攻击的智能体协作基础设施有直接参考价值。
- 论文公开站arXiv
SPARCL:基于谱分解的解析持续学习方法
SPARCL: Spectral Partitioned Analytic Continual Learning
SPARCL是一种新的解析持续学习方法,通过将自相关矩阵分解为高能核心和残差部分,仅更新残差块,从而避免旧类特征谱干扰。实验表明,在CIFAR-100、CUB-200等数据集上,SPARCL显著缩小了与强表示匹配方法的差距,并与Fly-CL等方法互补。
意义:为持续学习提供新理论视角,简化更新过程,提升旧类稳定性,对类增量学习场景有实际应用价值。