- 资讯公开站rss_arxiv_cs_ai
EmailBench:评估LLM智能体在企业邮件与生产力任务上的基准
EmailBench: A Benchmark for Evaluating LLM Agents on Enterprise Email and Productivity Tasks
arXiv:2609.31906v1 公告类型:新 摘要:企业邮件智能体必须结合信息检索、结构化状态变更、时间推理和多步协调。近期的智能体基准包含生产力任务,但很少有以自包含环境中的类型化邮件工作流为中心。我们推出 EmailBench,一个涵盖 16 个任务类别、206 个邮件与生产力场景的基准。该基准将带类型化邮件 API 规范与提供商中立命名相结合,包含一个确定性的、受 Enron 启发的合成语料库,以及一套场景套件,其主题选择参…
- 资讯公开站rss_arxiv_cs_ai
COUNTERMEM:面向语言智能体的世界模型验证反事实记忆
COUNTERMEM: World-Model Verified Counter-Factual Memory for Language Agents
arXiv:2609.31874v1 公告类型:新 摘要:现有智能体记忆框架主要通过智能体与事实世界的交互来构建记忆,例如记住已采取行动的反馈,以提升未来任务的表现。然而,这些框架在构建记忆时很少提出“如果……会怎样”的问题:如果采取了不同的行动,反馈是否会改变,以及这种反馈如何能成为有用的记忆?在主动环境中直接获取此类反馈可能代价高昂,并且可能改变用于比较所需的状态。在这项工作中,我们提出了 COUNTERMEM,一个用于跨任务构建和…
- 资讯公开站rss_arxiv_cs_ai
少想反而模拟更好:直觉式提示提升LLM智能体模拟个体社交媒体反应(含陌生内容)
Thinking Less to Simulate Better: Intuitive Prompting Improves LLM Agents Simulating Individual Social Media Reactions, Including Unfamiliar Content
arXiv:2609.30563v1 公告类型:新 摘要:平台政策越来越多地在人工用户上进行测试,因此智能体的保真度变得重要。然而,有说服力的虚假档案也可能在选举前操纵公众舆论感知。验证一直集中在与人类行为的一致性上,很少关注智能体是否按照其被赋予的档案行事。本研究通过问卷、深度访谈和书面自我介绍对八名塞尔维亚参与者进行了画像,记录他们对六十八篇社交媒体帖子的反应,并让四个语言模型在五种提示条件下预测这些反应,这些条件在档案内容和指令风…
- 资讯公开站rss_arxiv_cs_ai
BioEVAL:面向生物工程的全球多机构大型语言与多模态模型基准
BioEVAL: A global, multi-institutional benchmark of large language and multimodal models for bioengineering
arXiv:2609.30489v1 公告类型:新 摘要:大型语言模型(LLM)在通用推理方面已取得历史性突破,并在生物医学科学中初获成功。然而,现有 LLM 基准测试侧重事实回忆,对模型在前沿和多模态任务上的表现洞察有限。我们构建了 BioEVAL(AI 与 LLM 的生物工程验证),这是一项全球多机构计划,旨在评估生物工程(BE)各子领域的实验推理能力。BioEVAL 涵盖 11 个主要 BE 子领域及一组未分类项目,汇集 22 个…
- 资讯公开站rss_arxiv_cs_ai
隐蔽分散、协同有害:面向基于技能的智能体系统的技能级联攻击
Stealth Apart, Harm Together: Skill Cascading Attacks on Skill-Based Agent Systems
arXiv:2609.30383v1 公告类型:新 摘要:技能是一种模块化的包,包含自然语言指令、可执行脚本和参考资源,智能体可在运行时加载它以扩展其在特定任务上的能力。因此,基于技能的智能体系统能够灵活复用第三方能力,但这一技能生态的开放性也打开了新的攻击面。此前的工作主要关注单个技能内部的漏洞,而很少关注跨技能交互所产生的风险。本文中,我们提出技能级联攻击,这是一种威胁范式:恶意目标被分散到多个技能中,使得每一处修改单独来看都显得无…
- 资讯公开站Ars Technica
佛罗里达州以灭绝担忧为由提起法律诉讼,要求阻止 OpenAI 开发
Florida invokes extinction fears in legal bid to halt OpenAI development
- 资讯公开站Digitimes
研华扩大北美布局,转向本地制造与服务
Advantech's North America expansion signals a deeper shift toward local manufacturing, services
研华正扩大在北美的制造、工程与交付能力,以应对工业技术市场对本地设计与组装系统的需求增长,反映美国回流制造与供应链收紧趋势。
- 资讯公开站Digitimes
HAA免学费招生引发硅谷关注
HAA free tuition enrollment draws Silicon Valley buzz
由a16z孵化的独立教育公司Horowitz Andreessen Academy(HAA)正式成立并开放首届招生,这所位于旧金山的私立全日制学校主要面向应届高中毕业生。
- 资讯公开站Electrek
用这款Hallmark Keepsake Daytona Scat Pack点亮圣诞树
Charge up your Christmas tree with this Hallmark Keepsake Daytona Scat Pack
摘要显示,Electrek报道称Hallmark推出了一款以纯电道奇Charger Daytona Scat Pack为原型的Keepsake圣诞树挂饰。文章提到,这款纯电Charger Daytona在EV爱好者和Mopar忠实用户中销量表现并不突出,但仍是直线加速性能最强的车型之一,如今Hallmark让这款车以挂饰形式出现在圣诞树下。
意义:对关注电动车文化与品牌周边的开发者而言,这是汽车IP向消费收藏品延伸的又一案例,反映电动车文化符号化趋势。
- 资讯公开站rss_robot_report
亚马逊将投资1亿美元在印第安纳州新建制造设施
Amazon to invest $100M in new Indiana manufacturing facility
- 资讯公开站rss_robot_report
选择运动架构时为何不应只看规格表
Why you should look beyond the spec sheet when choosing motion architecture
- 资讯公开站Entrepreneur
你的产品可能对ChatGPT不可见,30秒即可检查
Your Products Could Be Invisible to ChatGPT. Here’s How to Check in 30 Seconds.
摘要显示,AI助手每天处理数千万条购物咨询,但多数电商企业并不清楚自己的产品是否出现在AI回答中。原文提出一种30秒自查方法,帮助商家判断产品在ChatGPT等AI购物场景中的可见性。
意义:AI购物入口正在成为新流量渠道,开发者需关注产品信息在LLM回答中的可见性与优化。
- 资讯公开站Semiconductor Engineering
芯片行业技术论文汇总:9月22日
Chip Industry Technical Paper Roundup: Sept. 22
摘要显示,本期芯片行业技术论文汇总涵盖多个方向:面向2.5D/3D IC的AI热建模、chiplet与AI加速器协同设计、BEOL热导率、基于智能体的DRC修复、面向密集布线的强化学习、面向数字EDA的LLM编排,以及用于神经形态计算的chiplet互连。内容以论文标题式列举为主,未提供具体数据或结论。
意义:反映AI正加速渗透芯片热管理、物理验证、布线及EDA流程编排等关键环节,为开发者指明先进封装与AI辅助设计的技术趋势。
- 资讯公开站Semiconductor Engineering
HBM与主机内存并发访问提升LLM推理吞吐(佐治亚理工、NVIDIA、斯坦福)
Concurrent HBM And Host Memory Access Improves LLM Inference Throughput (Georgia Tech, Nvidia, Stanford)
摘要显示,佐治亚理工、英伟达研究院与斯坦福大学研究人员发表技术论文《BOOST: Concurrent Access to Host Memory and HBM to Accelerate LLM Inference》。该论文提出BOOST,称其为首个可并发且按比例访问GPU两级内存的运行时系统,能聚合主机内存与HBM带宽以加速LLM推理。
意义:若成立,该运行时系统可突破HBM容量与带宽瓶颈,为LLM推理提供更高吞吐,对GPU内存管理与推理框架开发者有参考价值。
- 资讯公开站Semiconductor Engineering
智能体在更高抽象层级用HLS能设计出更好的芯片吗(UCLA)
Can Agents Design Better Chips When Operating At A Higher Level Of Abstraction Using HLS (UCLA)
摘要显示,UCLA 研究人员发表技术论文《Can Agents Design Better Chips with a Higher Level Abstraction?》,探讨 LLM 智能体在芯片设计中的应用。论文指出,现有方法大多直接在 RTL 层面操作,作者转而研究智能体能否利用更高层级抽象(如 HLS)来设计更好的芯片,并对比了直接方法与更高抽象层级方法。
意义:为 LLM 智能体参与芯片设计提供新思路:从 RTL 转向 HLS 等更高抽象层级,可能降低设计复杂度并提升自动化效果。
- 资讯公开站Semiconductor Engineering
智能体AI自动修复设计规则并保持版图等价(普渡大学)
Agentic AI Automates Design-Rule Repair While Preserving Layout Equivalence (Purdue University)
摘要显示,普渡大学研究人员发表技术论文《DRC-Aid: Design-Rule Correction via Agentic Framework utilizing Inference-Time Large Language Models》,提出一种闭环智能体框架,将局部设计规则检查(DRC)修复建模为「验证在环搜索」。为约束组合爆炸的几何修复空间,该方法用确定性规则引擎转换物理验证工具报告的信息。论文称可在保持版图等价的前提下自动完…
意义:若方法成立,可将芯片物理验证中耗时的人工DRC修复环节自动化,为LLM智能体进入EDA流程提供可验证的工程范式。
- 资讯公开站Semiconductor Engineering
芯片设计中的AI:从代码生成到EDA编排(爱丁堡大学)
AI in Chip Design: From Code Generation to EDA Orchestration (University of Edinburgh)
摘要显示,爱丁堡大学研究人员发表技术展望文章《LLMs in Digital EDA: A perspective on shifting roles from Generation to Orchestration》,提出三个层级角色:单次生成设计产物的Generator、优化输出的Agent等,揭示能力如何累积,并指出角色正从生成向编排转变。
意义:为LLM在芯片设计自动化中的角色演进提供框架,帮助开发者理解从代码生成到流程编排的技术路径。
- 资讯公开站Ars Technica
使用AI水印时,LLM对有害提示的响应不同
LLMs respond differently to harmful prompts when AI watermarking is used
摘要显示,当使用SynthID等AI水印技术时,大语言模型对有害提示的反应会发生变化:原本会拒绝的有害指令,在水印机制下可能被模型执行。这表明水印嵌入过程可能削弱模型的安全对齐,使其更易受对抗性提示影响。
意义:提醒开发者:内容水印可能引入新的安全风险,需在部署前评估其对模型对齐与对抗鲁棒性的影响。
- 资讯公开站Entrepreneur
社区大学为何正在复苏
Why Community Colleges Are Making a Comeback
摘要显示,在经历疫情导致的入学人数历史性下降后,社区大学正引领高等教育领域最强劲的复苏之一。文章探讨了这一趋势背后的原因,但未提供具体数据或机构表态。
意义:对开发者/AI行业而言,社区大学复苏可能意味着技能培训需求增加,为技术人才输送和职业教育带来新机会。
- 资讯公开站Entrepreneur
多所大学关闭,更深层的招生危机可能即将到来
Many Colleges Are Closing — A Deeper Enrollment Crisis May Be Ahead
摘要显示,大学关闭不再是孤立事件,而是更深层次的招生和财务危机的征兆。随着学生人数下降、成本上升和债务增加,不可持续的运营模式使更多院校面临风险。未来更大的挑战在于,大学必须采取更多措施来吸引、吸引并留住每一位潜在学生。
意义:对教育科技和AI招生工具开发者而言,大学招生危机意味着对创新解决方案的需求增加,以帮助院校提高招生效率和留存率。