- 论文公开站arXiv
Cogentic:面向自动证明发现的多智能体编排
Cogentic: Multi-Agent Orchestration for Automated Proof Discovery
提出 Cogentic,一个用于开放研究问题自动证明发现的多智能体框架。前沿语言模型虽能单次生成优质数学想法,但面对需多路径探索的开放问题,单次生成往往不足。
- 资讯公开站rss_arxiv_cs_ai
经验时代的自发现强化学习:学习历史是资产还是负担?
Self-discovering RL in the Era of Experience: Is Learning History an Asset or a Burden?
arXiv:2609.35897v1 公告类型:新 摘要:通往通用智能的递归自我改进(RSI)研究分为两条路线:宏观层面的语言模型扩展,以及“经验时代”中由交互驱动的原则。然而,任何自我改进架构最终都依赖于其底层优化引擎:如果通用智能需要从有根基的交互中学习,那么强化学习(RL)更新规则本身就必须具备累积适应能力。尽管算法自发现已产生 Disco103,其超越了 PPO 并达到 SOTA 基准表现,但其内部更新机制仍是一个未被审视的黑箱…
- 资讯公开站rss_arxiv_cs_ai
超越对称智能体:小语言模型中的认知多样性与多智能体辩论
Beyond Symmetric Agents: Cognitive Diversity and Multi-Agent Debate in Small Language Models
arXiv:2609.35875v1 公告类型:新 摘要:多智能体辩论(MAD)据称能比单模型推理提升推理与事实性,但以往工作将智能体视为对称同伴,未阐明增益来源。我们检验了智能体间认知多样性是驱动因素的假设,场景选在问题仍可测量的情形:具有基准提升空间的小型开放权重模型。我们覆盖来自十一个厂商家族的23个模型、五项任务、5500余次辩论与对照运行,沿三个轴变化多样性——人设、采样温度和模型身份——并将每种辩论配置与生成预算匹配的多数投…
- 资讯公开站rss_arxiv_cs_ai
有效的大语言模型微调是否必须依赖人类可读文本?
Is Human-Readable Text Necessary for Effective LLM Fine-Tuning?
arXiv:2609.35868v1 公告类型:新 摘要:有效微调大语言模型是否必须依赖人类可读性?我们研究模型条件化的训练表示能否在无需人类可读文本形式的情况下保持或提升适配效用。我们提出 Desired-Update-Aligned Synthetic Data(DASA),利用冻结参考模型的激活梯度反馈来指导连续合成输入嵌入的优化。受激活梯度在局部风险降低中作用的启发,DASA 针对有用的适配更新,而非源文本重建或语言流畅性。所得…
- 资讯公开站rss_arxiv_cs_ai
面向资源受限边缘设备可靠推理的神经符号路由
Neurosymbolic Routing for Reliable Reasoning on Resource-Constrained Edge Devices
在边缘硬件上运行语言模型可在无网络连接的情况下提供私密、低延迟的推理,但适合此类设备的小模型在计算机本应擅长的任务(如算术、代数和形式逻辑问题)上并不可靠。我们认为这种不可靠性在很大程度上是可以避免的。许多看似需要推理的查询实际上是结构确定性的,可以用快速且精确的符号方法求解。因此,强迫概率模型去近似它们只会牺牲准确性和能耗而收益甚微。我们提出一种神经符号路由器,对每个传入查询进行分类,并将其分派给成本最低的正确求解器:将结构化任务发送…
- 论文公开站arXiv
打破同质化陷阱:通过SplitMoE扩展视频扩散模型
Breaking the Uniformity Trap: Scaling Video Diffusion Model via SplitMoE
受大语言模型启发的混合专家(MoE)是扩展视觉生成模型的有前景范式,但传统token级MoE在同类专家池中独立路由token并趋向均匀化,限制了性能。本文提出SplitMoE方法。
- 论文公开站arXiv
AdviSD:通过定向多轮自蒸馏学习指导前沿大模型
AdviSD: Learning to Advise Frontier LLMs via Targeted Multi-Turn Self-Distillation
小型可训练顾问可利用自然语言建议引导冻结的语言模型执行器。除任务奖励外,顾问还可利用已完成交互的反馈改进建议,但看似合理的纠正未必能改变执行结果。
- 论文公开站arXiv
大模型图重建失真的谱理论:紧界与实证刻画
A Spectral Theory of Distortion in LLM Graph Reconstruction: Sharp Bounds and Empirical Characterization
语言模型图重建评估通常报告原始图与重建图之间的单一聚合距离。本文证明对于拉普拉斯谱间的Wasserstein距离,该汇总受两个边计数约束。
- 资讯公开站rss_arxiv_cs_ai
通过嵌入式编码改进大语言模型的医学计算能力
Improving Medical Calculation of LLMs with Embedded Coding
arXiv:2609.31908v1 公告类型:新 摘要:大语言模型(LLM)在医学考试和问答基准上表现良好,但在需要精确数值输出的医学计算任务上仍不可靠。这些计算支撑着用药剂量、器官功能评估和预后评分等高风险决策,即使很小的误差也可能带来严重的临床后果。我们提出 MedCode,一个通过训练 LLM 生成嵌入式可执行代码来改进医学计算的框架。给定临床情境,模型识别相关计算器,提取其输入变量,并生成一段将算术运算委托给确定性解释器的脚本…
- 论文公开站arXiv
伸缩式语言模型
Telescopic Language Models
一个已部署的语言模型常需服务多种算力预算,而每个预算点仍需单独训练或压缩;本文训练伸缩式语言模型(TLM)作为连续体,由随机前缀监督的嵌套容量Transformer构成。
- 资讯公开站rss_arxiv_cs_ai
少想反而模拟更好:直觉式提示提升LLM智能体模拟个体社交媒体反应(含陌生内容)
Thinking Less to Simulate Better: Intuitive Prompting Improves LLM Agents Simulating Individual Social Media Reactions, Including Unfamiliar Content
arXiv:2609.30563v1 公告类型:新 摘要:平台政策越来越多地在人工用户上进行测试,因此智能体的保真度变得重要。然而,有说服力的虚假档案也可能在选举前操纵公众舆论感知。验证一直集中在与人类行为的一致性上,很少关注智能体是否按照其被赋予的档案行事。本研究通过问卷、深度访谈和书面自我介绍对八名塞尔维亚参与者进行了画像,记录他们对六十八篇社交媒体帖子的反应,并让四个语言模型在五种提示条件下预测这些反应,这些条件在档案内容和指令风…
- 资讯公开站rss_arxiv_cs_ai
BioEVAL:面向生物工程的全球多机构大型语言与多模态模型基准
BioEVAL: A global, multi-institutional benchmark of large language and multimodal models for bioengineering
arXiv:2609.30489v1 公告类型:新 摘要:大型语言模型(LLM)在通用推理方面已取得历史性突破,并在生物医学科学中初获成功。然而,现有 LLM 基准测试侧重事实回忆,对模型在前沿和多模态任务上的表现洞察有限。我们构建了 BioEVAL(AI 与 LLM 的生物工程验证),这是一项全球多机构计划,旨在评估生物工程(BE)各子领域的实验推理能力。BioEVAL 涵盖 11 个主要 BE 子领域及一组未分类项目,汇集 22 个…
- 论文公开站arXiv
大语言模型用于结构化临床数据分析:双智能体接地与验证
Large Language Models for Structured Clinical Data Analysis: Dual-Agent Grounding and Validation
目标:开发并表征 CLEAR-Med,一种用于结构化临床数据自然语言分析的双智能体框架,将基于 SQL 的调用与独立验证分离。方法:CLEAR-Med 使用一个智能体将问题转化为可执行的结构化查询。
- 论文公开站arXiv
约束强化学习中的视觉-语言信号:安全增益但无预判能力
Vision--Language Signals in Constrained RL: Safety Gains Without Anticipation
安全强化学习寻求在满足安全约束的同时最大化任务性能的策略。然而在驾驶基准中,碰撞成本通常仅在碰撞时出现,无法提前预警逼近的危险。冻结的视觉-语言模型被用于提供信号。
- 论文公开站arXiv
Kafila:在可信异构消费级机器集合上服务大语言模型
Kafila: Serving Large Language Models on a Trusted Set of Heterogeneous Commodity Machines
研究组成员或朋友圈各自拥有几台消费级计算机,但单台都不足以运行一个有能力的大语言模型。现有系统在开放集群中汇聚此类算力,而仅接纳可信机器的群体则无法使用。
- 论文公开站arXiv
用价值移植引导语言模型目标
Steering Language Model Goals with Value Transplant
推理模型常表现得仿佛在追求目标,但其努力并不总指向用户意图,有时导致意外结果。先前工作研究了模型如何通过“价值”内部追踪其目标进展。
- 资讯公开站Ars Technica
佛罗里达州以灭绝担忧为由提起法律诉讼,要求阻止 OpenAI 开发
Florida invokes extinction fears in legal bid to halt OpenAI development
- 论文公开站arXiv
语言模型的最小侵入式引导
Minimally Invasive Steering of Language Models
论文提出 MISVO(最小侵入式转向向量优化),在冻结语言模型的最终隐藏状态上加入向量以实现测试时奖励适配,并用诱导 token 分布的局部 KL 几何对干预进行惩罚。该 Fisher 二次型可通过与冻结语言模型 head 的矩阵-向量乘积解析求梯度,作者还给出序列级 KL 梯度分解。在约 1B–14B 参数模型的偏好与代码生成任务中,MISVO 在 7 个模型-任务设置中的 6 个取得最高平均奖励,多样性与连贯性接近 Best-of-…
意义:为冻结模型提供无需更新参数、更少损伤生成质量的测试时对齐方法,降低微调成本。
- 论文公开站arXiv
需求约束的已验证调试:四十亿参数冻结本地模型作为候选生成器
Requirement-Bound Verified Commissioning: A Frozen Four-Billion-Parameter Local Model as a Candidate Generator under an External Acceptance Layer with Verification and Release Authority
摘要显示,该研究为机电调试中的传感器坐标与极性绑定提出一种验收协议,将候选生成与发布权限分离:确定性解析器无法支持的需求被路由至一个冻结的40亿参数本地语言模型,仅当外部门控在密封语法下能推导出两项事实时才发布计划。在144项任务上评估,22项被路由的不可答任务中21项提交了伪造的“就绪”计划且全部被拒;83次发布中未观察到误发布,单侧95% Clopper-Pearson上界为0.0354,低于5%阈值。但基准外另有1次误发布记录。
意义:为LLM在安全关键工业场景中的使用提供“生成与发布分离”的验证架构,对构建可审计、可拒绝的AI调试系统有参考价值。
- 论文公开站arXiv
信还是不信:语音中的检索增强事实核查
To Trust or Not to Trust: Retrieval-Augmented Fact Checking in Speech
摘要显示,研究者提出 VeriSpeak,一个用于研究大型音频语言模型(LALM)语音事实核查能力的探针基准,包含 3,879 条口语化声明,覆盖时间、地理与关系类事实,真假标签均衡。实验发现文本与语音之间存在稳定的模态差距:能可靠核查书面声明的模型在同样内容以语音呈现时常常失败;仅靠检索收益有限,因为模型常将检索证据与语音声明混淆,而检索结合显式推理可提升声明-证据比对效果,思维调优的 LALM 达到 86.1% 准确率。
意义:提示开发者:语音场景下事实核查不能简单复用文本能力,需重视跨模态差距与检索证据的显式推理比对。
- 论文公开站arXiv
数学推理中顺序不变的答案与顺序敏感的表示
Order-Invariant Answers, Order-Sensitive Representations in Mathematical Reasoning
摘要显示,研究用合成多步函数复合任务测试16个1B至8B参数语言模型,在语义相同但规则顺序不同的题目下测量准确率与置换信噪比(SNR)。结果显示,能更准确解答重排问题的模型,其内部表征对不同规则顺序的区分度更高;层平均置换SNR与准确率在所有测试设置中均呈正秩相关,Spearman相关系数最高达0.86。研究据此提出应区分答案不变性与表征不变性。
意义:提示开发者:模型答案正确不等于内部表征对顺序不敏感,评估数学推理时需关注表征层面的顺序敏感性。
- 论文公开站arXiv
通过迭代去对齐估计罕见事件
Rare Event Estimation via Iterative Unalignment
摘要显示,该研究针对自主智能体随机输出轨迹中极稀有但可能灾难性的事件,提出一种新的重要性采样方法:通过可微扰动原模型权重构造提议分布,并联合事件放大可微代理与自适应正则化以平衡放大与估计稳定性。在约1.2亿和26亿参数模型、三类事件族、300多个稀有事件(稀有度低至10^-9)上评估,最可验证设置下相较朴素蒙特卡洛获得超过800倍计算加权效率提升。
意义:为评估自主智能体极端风险提供了可扩展的稀有事件概率估计工具,降低安全部署中风险量化的算力门槛。
- 论文公开站arXiv
MIGU:面向操作规划的不确定性下多模态指令接地
MIGU: Multimodal Instruction Grounding under Uncertainty for Manipulation Planning
摘要显示,MIGU 是一个模块化框架,用于在语言与手势线索互补但不确定的情况下进行多模态指令接地。它通过眼-指几何传播视线方向与深度不确定性构建三维几何似然,并结合视觉语言模型提供的语义先验,以类贝叶斯方式融合为统一接地信念,进而支持直接规划或请求澄清。真实基准上 MIGU 优于所评估基线,消融实验支持显式多模态不确定性建模的收益。
意义:为机器人在不确定语言与手势输入下提供可量化的接地与澄清机制,对具身智能与多模态规划有参考价值。
- 论文公开站arXiv
SeeQ:为长时程机器人操作训练通用价值函数
SeeQ: Training Generalist Value Functions for Long-Horizon Robotic Manipulation
摘要显示,通用机器人策略在包含多阶段或需反复尝试的长时程任务上表现脆弱。SeeQ 提出学习当前活跃子任务的 Q 值,以缩短价值预测时程,从而可用时序差分目标有效训练;训练时利用离线机器人数据中的子任务标注,测试时由视觉-语言骨干自回归预测自然语言子任务再估值。在两种双臂机器人平台的四个真实操作任务上,该方法显著提升了 best-of-N 策略引导效果。
意义:为长时程机器人操作提供可扩展的价值函数训练范式,降低稀疏奖励下的信用分配难度,对通用机器人策略与强化学习结合有参考价值。
- 资讯公开站Semiconductor Engineering
智能体AI自动修复设计规则并保持版图等价(普渡大学)
Agentic AI Automates Design-Rule Repair While Preserving Layout Equivalence (Purdue University)
摘要显示,普渡大学研究人员发表技术论文《DRC-Aid: Design-Rule Correction via Agentic Framework utilizing Inference-Time Large Language Models》,提出一种闭环智能体框架,将局部设计规则检查(DRC)修复建模为「验证在环搜索」。为约束组合爆炸的几何修复空间,该方法用确定性规则引擎转换物理验证工具报告的信息。论文称可在保持版图等价的前提下自动完…
意义:若方法成立,可将芯片物理验证中耗时的人工DRC修复环节自动化,为LLM智能体进入EDA流程提供可验证的工程范式。