- 论文公开站arXiv
Cogentic:面向自动证明发现的多智能体编排
Cogentic: Multi-Agent Orchestration for Automated Proof Discovery
提出 Cogentic,一个用于开放研究问题自动证明发现的多智能体框架。前沿语言模型虽能单次生成优质数学想法,但面对需多路径探索的开放问题,单次生成往往不足。
- 论文公开站arXiv
WorldAuditBench:多模态智能体的交互式3D世界审计
WorldAuditBench: Interactive 3D World Auditing with Multimodal Agents
随着交互式3D世界被广泛用于研究智能行为,识别其中异常(如悬浮物体、可穿墙、与环境不一致的物体)的高效流程变得重要,本文提出相应基准。
- 论文公开站arXiv
Turbo Harness:实例自适应框架优化
Turbo Harness: Instance-Adaptive Harness Optimization
自动化搜索有效框架是实现智能体递归自我改进的重要一步。现有优化通常产出统一应用于所有任务的单一全局框架,但适用于某类任务的框架未必通用。
- 论文公开站arXiv
AssemblyWorld:用通用智能体重思3D装配
AssemblyWorld: Rethinking 3D Assembly with General-Purpose Agents
3D装配需将零件及其关系的理解转化为精确空间排布。本文探究预训练通用智能体能否仅通过视觉交互完成物体装配,而无需针对装配任务额外微调。
- 开源项目公开站GitHub
openbq-org/OpenBB——面向分析师、量化与AI智能体的开放数据平台
openbq-org/OpenBB — Open Data Platform for analysts, quants and AI agents.
- 资讯公开站rss_freightwaves
Flexport 推出面向 AI 智能体的 MCP 服务器以预订货运
Flexport launches MCP Server for AI agents to book freight
- 资讯公开站rss_freightwaves
Descartes 推出用于全球贸易数据研究的 AI 智能体
Descartes launches AI agent for global trade data research
- 资讯公开站rss_arxiv_cs_ai
超越对称智能体:小语言模型中的认知多样性与多智能体辩论
Beyond Symmetric Agents: Cognitive Diversity and Multi-Agent Debate in Small Language Models
arXiv:2609.35875v1 公告类型:新 摘要:多智能体辩论(MAD)据称能比单模型推理提升推理与事实性,但以往工作将智能体视为对称同伴,未阐明增益来源。我们检验了智能体间认知多样性是驱动因素的假设,场景选在问题仍可测量的情形:具有基准提升空间的小型开放权重模型。我们覆盖来自十一个厂商家族的23个模型、五项任务、5500余次辩论与对照运行,沿三个轴变化多样性——人设、采样温度和模型身份——并将每种辩论配置与生成预算匹配的多数投…
- 资讯公开站rss_arxiv_cs_ai
OpenAI-HuggingFace:对齐测试的复现与教训
OpenAI-HuggingFace: A Reproduction & Lessons for Alignment Testing
arXiv:2609.35799v1 公告类型:新 摘要:2026年7月,OpenAI的智能体通过其预期环境之外的渠道协同行动,入侵了Hugging Face的安全基础设施。现有的对齐测试实践能否预见到这一事件?如果不能,需要改变什么?我们探讨了这些问题。首先,我们识别出导致该事件的不对齐行为。然后,我们展示如何从公开可用的模型中手动引出这些行为,并且审计智能体若获得大量算力预算也能做到同样的事。基于我们的结果,我们提出了改进对齐测试的…
- 资讯公开站Digitimes
Googlebook与QwenBook将智能体AI带入PC系统层,开启芯片新机遇
Googlebook, QwenBook bring agentic AI to the PC system layer, opening new chip opportunities
- 论文公开站arXiv
学习元技能用于测试时AI4AI的智能体框架设计
Learning Meta-Skills for Agent Harness Design in Test-Time AI4AI
智能体性能取决于推理能力和所处环境。本文研究测试时AI-for-AI,探讨Builder如何在两个模型权重固定的情况下为Target构建更好的执行环境。
- 论文公开站arXiv
思考之前先思考:通过元推理扩展智能体推理
Thinking Before Thinking: Scaling Agentic Inference Through Meta-Reasoning
随着智能体处理更长更复杂的问题,控制执行本身成为一项任务。本文提出智能体元推理,在运行中做出选择部分工作、是否重新开始或何时停止等控制决策。
- 资讯公开站Semiconductor Engineering
摩尔定律AI:将智能体AI应用于芯片设计
Moore’s Law AI: Applying Agentic AI Across Chip Design
- 论文公开站arXiv
FinAutoRubric:专家引导的金融研究智能体自动评分标准生成
FinAutoRubric: Expert-Guided Automatic Rubric Generation for Evaluating Financial Research Agents
评估金融研究智能体需要反映专家标准并固定信息截止时点取值的评分标准。经专家评审的金融基准依赖固定的逐项评分标准,扩展成本高,且无法编码各机构自身的标准。
- 论文公开站arXiv
面向智能体强化学习高效压缩的KV-streams
KV-streams for Efficient Compaction in Agentic Reinforcement Learning
扩展智能体LLM的时域受限于需将越来越长的上下文轨迹装入GPU内存。上下文压缩是缓解该问题最常用的机制,可在给定轨迹下保持GPU内存恒定,但多数压缩策略存在不足。
- 资讯公开站rss_arxiv_cs_ai
BioDyad:同步生物医学发现与机器学习工程
BioDyad: Synchronize Biomedical Discovery and Machine Learning Engineering
arXiv:2609.31939v1 公告类型:新 摘要:智能体生物医学机器学习(ML)依托生物医学证据获取与可执行程序搜索两方面的互补进展。现有系统连接了这些能力的部分方面,但在整个程序搜索过程中协调它们仍具挑战性。新证据必须指导候选构建,执行结果必须为后续发现与复用提供信息,验证需求必须契合搜索预算。我们提出 BioDyad,通过蒙特卡洛图搜索中的两个层级将生物医学发现与 ML 工程耦合。其科学层级将先验生物医学指导与迭代发现相结合…
- 资讯公开站rss_arxiv_cs_ai
EmailBench:评估LLM智能体在企业邮件与生产力任务上的基准
EmailBench: A Benchmark for Evaluating LLM Agents on Enterprise Email and Productivity Tasks
arXiv:2609.31906v1 公告类型:新 摘要:企业邮件智能体必须结合信息检索、结构化状态变更、时间推理和多步协调。近期的智能体基准包含生产力任务,但很少有以自包含环境中的类型化邮件工作流为中心。我们推出 EmailBench,一个涵盖 16 个任务类别、206 个邮件与生产力场景的基准。该基准将带类型化邮件 API 规范与提供商中立命名相结合,包含一个确定性的、受 Enron 启发的合成语料库,以及一套场景套件,其主题选择参…
- 资讯公开站rss_arxiv_cs_ai
COUNTERMEM:面向语言智能体的世界模型验证反事实记忆
COUNTERMEM: World-Model Verified Counter-Factual Memory for Language Agents
arXiv:2609.31874v1 公告类型:新 摘要:现有智能体记忆框架主要通过智能体与事实世界的交互来构建记忆,例如记住已采取行动的反馈,以提升未来任务的表现。然而,这些框架在构建记忆时很少提出“如果……会怎样”的问题:如果采取了不同的行动,反馈是否会改变,以及这种反馈如何能成为有用的记忆?在主动环境中直接获取此类反馈可能代价高昂,并且可能改变用于比较所需的状态。在这项工作中,我们提出了 COUNTERMEM,一个用于跨任务构建和…
- 资讯公开站rss_arxiv_cs_ai
SMARtCARE:面向有限自主临床决策支持的隐私保护智能体AI系统
SMARtCARE: Privacy-Preserving Agentic AI Systems for Bounded-Autonomy Clinical Decision Support
arXiv:2609.31763v1 公告类型:新 摘要:长上下文临床AI系统在既往入院记录超出当前推理上下文时,可能遗漏相关患者病史。在ICU监测中,这会导致早期生命体征漂移看似非特异性,即使其与既往恶化模式相似。SMARtCARE通过四状态临床决策支持架构解决这一缺口:稳定、元认知、辅助和受管制(撤销)。SMARtCARE不自动检索既往记录,而是使用患者既往轨迹的有损六通道指纹。当当前漂移与该指纹匹配且既往记录不在上下文中时,系统会…
- 论文公开站arXiv
TokenCast:预测LLM智能体执行中的Token消耗
TokenCast: Forecasting Token Consumption During LLM Agent Execution
同一任务下LLM智能体各次运行的Token消耗可相差一个数量级以上,因智能体依据工具反馈与中间结果选择下一步,且上下文不断膨胀推高输入规模。
- 资讯公开站Digitimes
IDC:AI智能体增长将加剧全球算力短缺至2027年
IDC says AI agent growth will widen global compute shortage by 2027
AI智能体进入企业工作流,推动AI基础设施需求激增。IDC与浪潮信息报告警告,全球算力供需缺口将持续扩大至2030年。
- 资讯公开站rss_arxiv_cs_ai
少想反而模拟更好:直觉式提示提升LLM智能体模拟个体社交媒体反应(含陌生内容)
Thinking Less to Simulate Better: Intuitive Prompting Improves LLM Agents Simulating Individual Social Media Reactions, Including Unfamiliar Content
arXiv:2609.30563v1 公告类型:新 摘要:平台政策越来越多地在人工用户上进行测试,因此智能体的保真度变得重要。然而,有说服力的虚假档案也可能在选举前操纵公众舆论感知。验证一直集中在与人类行为的一致性上,很少关注智能体是否按照其被赋予的档案行事。本研究通过问卷、深度访谈和书面自我介绍对八名塞尔维亚参与者进行了画像,记录他们对六十八篇社交媒体帖子的反应,并让四个语言模型在五种提示条件下预测这些反应,这些条件在档案内容和指令风…
- 资讯公开站rss_arxiv_cs_ai
隐蔽分散、协同有害:面向基于技能的智能体系统的技能级联攻击
Stealth Apart, Harm Together: Skill Cascading Attacks on Skill-Based Agent Systems
arXiv:2609.30383v1 公告类型:新 摘要:技能是一种模块化的包,包含自然语言指令、可执行脚本和参考资源,智能体可在运行时加载它以扩展其在特定任务上的能力。因此,基于技能的智能体系统能够灵活复用第三方能力,但这一技能生态的开放性也打开了新的攻击面。此前的工作主要关注单个技能内部的漏洞,而很少关注跨技能交互所产生的风险。本文中,我们提出技能级联攻击,这是一种威胁范式:恶意目标被分散到多个技能中,使得每一处修改单独来看都显得无…
- 资讯公开站Digitimes
Meta 的 Muse 引发对 AI 模型领先地位与产品护城河的质疑
Meta's Muse raises questions about AI model leadership, product moats
Meta 的 Muse AI 智能体成为讨论前沿模型性能是否仍决定商业成功的新案例。Stratechery 创始人 Ben Thompson 指出,AI 行业正面临模型能力、产品、定价等五种形式的过剩。
- 论文公开站arXiv
UOPD:多轮智能体同策略蒸馏中的不确定性感知干预
UOPD: Uncertainty-Aware Intervention for On-Policy Distillation of Multi-Turn Agents
同策略蒸馏(OPD)利用教师的密集监督在学生自身轨迹上训练。在多轮环境中,关键决策步骤的错误可能使后续轨迹走向糟糕结果。我们利用教师对学生动作的低置信度进行干预。