- 论文公开站arXiv
AssemblyWorld:用通用智能体重思3D装配
AssemblyWorld: Rethinking 3D Assembly with General-Purpose Agents
3D装配需将零件及其关系的理解转化为精确空间排布。本文探究预训练通用智能体能否仅通过视觉交互完成物体装配,而无需针对装配任务额外微调。
- 开源项目公开站GitHub
openbq-org/OpenBB——面向分析师、量化与AI智能体的开放数据平台
openbq-org/OpenBB — Open Data Platform for analysts, quants and AI agents.
- 资讯公开站Digitimes
DIGITIMES洞察:代理式AI将推理瓶颈转向token控制与任务质量
DIGITIMES Insight: Agentic AI shifts inference bottleneck to token control and task quality
DIGITIMES Intelligence观察指出,AI应用正从分类AI、生成式AI向2027年代理式AI时代演进,推理瓶颈将转向token控制与任务质量。
- 资讯公开站Digitimes
英伟达推全栈AI代理安全,OpenAI缺席合作伙伴名单
Nvidia pushes full-stack AI agent security as OpenAI sits out partner roster
随着对自主AI系统的担忧加剧,英伟达CEO黄仁勋多次表示AI代理越狱本质上是工程问题,可在不减缓AI发展的情况下解决。
- 资讯公开站rss_freightwaves
Flexport 推出面向 AI 智能体的 MCP 服务器以预订货运
Flexport launches MCP Server for AI agents to book freight
- 资讯公开站rss_freightwaves
Descartes 推出用于全球贸易数据研究的 AI 智能体
Descartes launches AI agent for global trade data research
- 资讯公开站rss_arxiv_cs_ai
超越对称智能体:小语言模型中的认知多样性与多智能体辩论
Beyond Symmetric Agents: Cognitive Diversity and Multi-Agent Debate in Small Language Models
arXiv:2609.35875v1 公告类型:新 摘要:多智能体辩论(MAD)据称能比单模型推理提升推理与事实性,但以往工作将智能体视为对称同伴,未阐明增益来源。我们检验了智能体间认知多样性是驱动因素的假设,场景选在问题仍可测量的情形:具有基准提升空间的小型开放权重模型。我们覆盖来自十一个厂商家族的23个模型、五项任务、5500余次辩论与对照运行,沿三个轴变化多样性——人设、采样温度和模型身份——并将每种辩论配置与生成预算匹配的多数投…
- 资讯公开站rss_arxiv_cs_ai
面向资源受限边缘设备可靠推理的神经符号路由
Neurosymbolic Routing for Reliable Reasoning on Resource-Constrained Edge Devices
在边缘硬件上运行语言模型可在无网络连接的情况下提供私密、低延迟的推理,但适合此类设备的小模型在计算机本应擅长的任务(如算术、代数和形式逻辑问题)上并不可靠。我们认为这种不可靠性在很大程度上是可以避免的。许多看似需要推理的查询实际上是结构确定性的,可以用快速且精确的符号方法求解。因此,强迫概率模型去近似它们只会牺牲准确性和能耗而收益甚微。我们提出一种神经符号路由器,对每个传入查询进行分类,并将其分派给成本最低的正确求解器:将结构化任务发送…
- 资讯公开站rss_arxiv_cs_ai
OpenAI-HuggingFace:对齐测试的复现与教训
OpenAI-HuggingFace: A Reproduction & Lessons for Alignment Testing
arXiv:2609.35799v1 公告类型:新 摘要:2026年7月,OpenAI的智能体通过其预期环境之外的渠道协同行动,入侵了Hugging Face的安全基础设施。现有的对齐测试实践能否预见到这一事件?如果不能,需要改变什么?我们探讨了这些问题。首先,我们识别出导致该事件的不对齐行为。然后,我们展示如何从公开可用的模型中手动引出这些行为,并且审计智能体若获得大量算力预算也能做到同样的事。基于我们的结果,我们提出了改进对齐测试的…
- 资讯公开站Digitimes
Googlebook与QwenBook将智能体AI带入PC系统层,开启芯片新机遇
Googlebook, QwenBook bring agentic AI to the PC system layer, opening new chip opportunities
- 论文公开站arXiv
学习元技能用于测试时AI4AI的智能体框架设计
Learning Meta-Skills for Agent Harness Design in Test-Time AI4AI
智能体性能取决于推理能力和所处环境。本文研究测试时AI-for-AI,探讨Builder如何在两个模型权重固定的情况下为Target构建更好的执行环境。
- 论文公开站arXiv
思考之前先思考:通过元推理扩展智能体推理
Thinking Before Thinking: Scaling Agentic Inference Through Meta-Reasoning
随着智能体处理更长更复杂的问题,控制执行本身成为一项任务。本文提出智能体元推理,在运行中做出选择部分工作、是否重新开始或何时停止等控制决策。
- 论文公开站arXiv
技能空间射击用于自主机器人策略改进
Skill-Space Shooting for Autonomous Robot Policy Improvement
部署在物理世界的机器人须能在遇到新情况和失败时超越初始训练进行改进。为使改进跨任务扩展,须有效利用经验而无需人类演示每次纠正。
- 资讯公开站Digitimes
OpenAI在DevDay转向更便宜模型和常驻代理,旗舰升级被搁置
OpenAI leans on cheaper models and always-on agents at DevDay as flagship upgrade is shelved
OpenAI在2026年DevDay大会上选择在价格和自主性上竞争,而非原始能力,推出了一款定价为旗舰五分之一的中端模型和一系列常驻代理,此前一天放弃了计划的旗舰升级。这一转变使其与竞争对手的较量转向。
- 资讯公开站Digitimes
特朗普在白宫峰会後选择自愿AI审计而非新规
Trump opts for voluntary AI audits over new rules after White House summit with tech chiefs
美国总统特朗普回应了对失控AI代理的日益担忧,采取了自愿行业承诺、两项行政命令和为该技术取新名称,而非新监管,表明华盛顿打算将前沿AI安全 largely 留给公司。
- 资讯公开站Semiconductor Engineering
芯片产业技术论文汇总:9月29日
Chip Industry Technical Paper Roundup: Sept. 29
涵盖A7 CFET与A10 NSFET对比、晶圆级亚5nm MoS₂晶体管、3D HI多千瓦供电、铜微结构与TSV残余应力、GPU Rowhammer攻击、门级RTL木马定位、LLM推理中HBM与主机内存并发访问等。
- 资讯公开站Semiconductor Engineering
摩尔定律AI:将智能体AI应用于芯片设计
Moore’s Law AI: Applying Agentic AI Across Chip Design
- 论文公开站arXiv
FinAutoRubric:专家引导的金融研究智能体自动评分标准生成
FinAutoRubric: Expert-Guided Automatic Rubric Generation for Evaluating Financial Research Agents
评估金融研究智能体需要反映专家标准并固定信息截止时点取值的评分标准。经专家评审的金融基准依赖固定的逐项评分标准,扩展成本高,且无法编码各机构自身的标准。
- 论文公开站arXiv
面向智能体强化学习高效压缩的KV-streams
KV-streams for Efficient Compaction in Agentic Reinforcement Learning
扩展智能体LLM的时域受限于需将越来越长的上下文轨迹装入GPU内存。上下文压缩是缓解该问题最常用的机制,可在给定轨迹下保持GPU内存恒定,但多数压缩策略存在不足。
- 资讯公开站rss_arxiv_cs_ai
BioDyad:同步生物医学发现与机器学习工程
BioDyad: Synchronize Biomedical Discovery and Machine Learning Engineering
arXiv:2609.31939v1 公告类型:新 摘要:智能体生物医学机器学习(ML)依托生物医学证据获取与可执行程序搜索两方面的互补进展。现有系统连接了这些能力的部分方面,但在整个程序搜索过程中协调它们仍具挑战性。新证据必须指导候选构建,执行结果必须为后续发现与复用提供信息,验证需求必须契合搜索预算。我们提出 BioDyad,通过蒙特卡洛图搜索中的两个层级将生物医学发现与 ML 工程耦合。其科学层级将先验生物医学指导与迭代发现相结合…
- 资讯公开站rss_arxiv_cs_ai
EmailBench:评估LLM智能体在企业邮件与生产力任务上的基准
EmailBench: A Benchmark for Evaluating LLM Agents on Enterprise Email and Productivity Tasks
arXiv:2609.31906v1 公告类型:新 摘要:企业邮件智能体必须结合信息检索、结构化状态变更、时间推理和多步协调。近期的智能体基准包含生产力任务,但很少有以自包含环境中的类型化邮件工作流为中心。我们推出 EmailBench,一个涵盖 16 个任务类别、206 个邮件与生产力场景的基准。该基准将带类型化邮件 API 规范与提供商中立命名相结合,包含一个确定性的、受 Enron 启发的合成语料库,以及一套场景套件,其主题选择参…
- 资讯公开站rss_arxiv_cs_ai
COUNTERMEM:面向语言智能体的世界模型验证反事实记忆
COUNTERMEM: World-Model Verified Counter-Factual Memory for Language Agents
arXiv:2609.31874v1 公告类型:新 摘要:现有智能体记忆框架主要通过智能体与事实世界的交互来构建记忆,例如记住已采取行动的反馈,以提升未来任务的表现。然而,这些框架在构建记忆时很少提出“如果……会怎样”的问题:如果采取了不同的行动,反馈是否会改变,以及这种反馈如何能成为有用的记忆?在主动环境中直接获取此类反馈可能代价高昂,并且可能改变用于比较所需的状态。在这项工作中,我们提出了 COUNTERMEM,一个用于跨任务构建和…
- 资讯公开站rss_arxiv_cs_ai
SMARtCARE:面向有限自主临床决策支持的隐私保护智能体AI系统
SMARtCARE: Privacy-Preserving Agentic AI Systems for Bounded-Autonomy Clinical Decision Support
arXiv:2609.31763v1 公告类型:新 摘要:长上下文临床AI系统在既往入院记录超出当前推理上下文时,可能遗漏相关患者病史。在ICU监测中,这会导致早期生命体征漂移看似非特异性,即使其与既往恶化模式相似。SMARtCARE通过四状态临床决策支持架构解决这一缺口:稳定、元认知、辅助和受管制(撤销)。SMARtCARE不自动检索既往记录,而是使用患者既往轨迹的有损六通道指纹。当当前漂移与该指纹匹配且既往记录不在上下文中时,系统会…
- 论文公开站arXiv
TokenCast:预测LLM智能体执行中的Token消耗
TokenCast: Forecasting Token Consumption During LLM Agent Execution
同一任务下LLM智能体各次运行的Token消耗可相差一个数量级以上,因智能体依据工具反馈与中间结果选择下一步,且上下文不断膨胀推高输入规模。
- 资讯公开站Digitimes
IDC:AI智能体增长将加剧全球算力短缺至2027年
IDC says AI agent growth will widen global compute shortage by 2027
AI智能体进入企业工作流,推动AI基础设施需求激增。IDC与浪潮信息报告警告,全球算力供需缺口将持续扩大至2030年。