- 资讯公开站rss_arxiv_cs_ai
PowerZooJax:面向强化学习的基于JAX的电力系统基准
PowerZooJax: A JAX-based Power System Benchmark for Reinforcement Learning
arXiv:2609.36052v1 公告类型:新 摘要:电力系统运行是一个安全关键的序贯决策问题,因此是强化学习(RL)的天然试验平台。然而,现有的电力系统RL环境往往范围狭窄,且受限于基于CPU的仿真工作流,难以进行大规模评估。我们提出PowerZooJax,一个基于JAX的电力系统运行RL基准套件。它提供五个约束马尔可夫决策过程任务,涵盖发电、输电、配电、分布式能源和数据中心微电网。通过将潮流计算、经济调度、市场出清和设备动态重写…
- 资讯公开站Digitimes
专访:讯飞医疗认为临床整合是韩国医疗AI扩展的关键
Interview: iFLYTEK Medical sees clinical integration as key to healthcare AI expansion in South Korea
中国科大讯飞旗下医疗AI子公司讯飞医疗正利用其星火医疗大模型支持诊断和病历生成,同时应对临床工作流整合、护理环境差异和模型幻觉等挑战。
- 资讯公开站rss_arxiv_cs_ai
EmailBench:评估LLM智能体在企业邮件与生产力任务上的基准
EmailBench: A Benchmark for Evaluating LLM Agents on Enterprise Email and Productivity Tasks
arXiv:2609.31906v1 公告类型:新 摘要:企业邮件智能体必须结合信息检索、结构化状态变更、时间推理和多步协调。近期的智能体基准包含生产力任务,但很少有以自包含环境中的类型化邮件工作流为中心。我们推出 EmailBench,一个涵盖 16 个任务类别、206 个邮件与生产力场景的基准。该基准将带类型化邮件 API 规范与提供商中立命名相结合,包含一个确定性的、受 Enron 启发的合成语料库,以及一套场景套件,其主题选择参…
- 资讯公开站Digitimes
IDC:AI智能体增长将加剧全球算力短缺至2027年
IDC says AI agent growth will widen global compute shortage by 2027
AI智能体进入企业工作流,推动AI基础设施需求激增。IDC与浪潮信息报告警告,全球算力供需缺口将持续扩大至2030年。
- 论文公开站arXiv
在线阴谋论的智能体检测
Agentic Detection of Online Conspiracies
摘要显示,社交媒体上的阴谋论话语并非总以明确主张或固定词汇标记出现,相同表层内容可能表达支持、合理关切、批评、讽刺或嘲弄,核心挑战在于推断说话者的言外之力。作者提出一个配备社会查询工具的智能体框架,利用社会语境进行判断,并在覆盖2018年末至2023年初约80%–90%希伯来语推文的独特数据集上验证。在人工标注的对抗性数据集上,语境感知工作流持续优于纯文本分类,智能体框架也显著优于其他框架与设置。
意义:为内容审核与虚假信息检测提供新思路:将阴谋论识别从文本分类转向社会语境推理,智能体加工具查询的范式对开发者构建可解释审核系统有参考价值。
- 资讯公开站EE Times
台积电设计生态演进:用 AI 塑造 AI 未来
Inside TSMC’s Evolving Design Ecosystem: Shaping the Future of AI, with AI
摘要显示,台积电在EE Times上分享了其开放创新平台生态的最新进展,并提出利用台积电AI设计套件(TSMC AI Design Kit)支持AI驱动的代理式工作流的愿景。文章标题强调以AI塑造AI的未来,但摘要未披露具体技术细节、性能数据或合作方信息。
意义:台积电设计生态向AI代理工作流延伸,可能影响芯片设计工具链与EDA生态走向。
- 资讯公开站Semiconductor Engineering
EDA的未来是证据驱动的自动化
EDA’s Future Is Evidence-Driven Automation
摘要显示,AI虽可加速半导体设计,但用户仍需形式化证明、语义连续性和可审计工作流来信任自动化。文章指出,证据驱动的自动化是EDA发展的关键方向。
意义:对AI在EDA中的应用提出信任与可验证性要求,影响开发者设计自动化工具的方向。
- 资讯公开站rss_robot_report
NVIDIA 称 Isaac ROS 5.0 将 AI 智能体引入机器人开发
Isaac ROS 5.0 brings AI agents to robotics development, says NVIDIA
- 资讯公开站EE Times
从量子比特到工作流:重新思考量子计算
From Qubits to Workflows: Rethinking Quantum Computing
摘要显示,IBM 正推动以量子为中心的思路,将量子处理单元(QPU)视为混合 AI-HPC 工作流中的又一种加速器,而非独立计算范式。该文章探讨了这种定位转变对量子计算应用与系统架构的影响。
意义:若 QPU 成为混合 AI-HPC 工作流中的加速器,开发者需重新思考量子与经典计算的协同编排方式。
- 资讯公开站Semiconductor Engineering
博客综述:9 月 23 日
Blog Review: Sept. 23
摘要显示,本期博客综述涵盖多个主题:数字孪生与热传感器、智能体AI工作流、物理AI需要新硅片,以及RF设计的变化。内容来自Semiconductor Engineering的博客汇总,具体细节需查阅原文。
意义:为开发者与AI行业提供半导体领域前沿动态,涉及AI工作流与芯片设计趋势。
- 论文公开站arXiv
类型安全不等于无错误:约束决策头遵循选项名而非绑定规则
Type-Safe Is Not Error-Free: A Constrained Decision Head Follows the Option Name, Not the Rubric Bound to It
摘要显示,该研究考察了Jev及两个类似的开源权重模型在仅改变选项名称与评分标准对应关系时的表现。在1200个工作流决策中,将选项从0/1重命名为no/yes后,每百次回答多出70.4次变化,AUC从0.94降至0.23,表明决策排序出现系统性反转。该效应在全部4个谓词上均成立,且随选项数量增加而增强,并受读出几何影响。
意义:提醒开发者:类型安全的结构化输出并不保证模型正确理解选项语义,选项命名可能显著影响决策可靠性。
- 开源项目公开站GitHub
harry0703/MoneyPrinterTurbo:AI 一键生成高清短视频
harry0703/MoneyPrinterTurbo — 利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short videos from a topic or keyword with an automated AI workflow.
摘要显示,MoneyPrinterTurbo 是一个利用 AI 大模型和自动化工作流、根据主题或关键词一键生成高清短视频的开源项目。其 GitHub 页面标注星标数约 124,850,说明该项目在开发者社区中具有较高关注度。摘要未披露所调用模型、生成流程细节或输出规格等信息。
意义:为开发者提供短视频自动生成的开源参考实现,可复用于内容生产与AI工作流集成。
- 资讯公开站Entrepreneur
7款AI工具助你周末打造一人企业
7 AI Tools That Build a One-Person Business in a Weekend — No Staff. No Code. No Stress.
摘要显示,文章介绍了7款AI工具,并展示其在研究、邮件、应用构建和自动化方面的实际工作流程,以及如何选择业务真正需要的工具。文章强调无需员工、无需编程、无压力,即可在周末建立一人企业。
意义:为独立开发者与创业者提供低门槛、高效率的AI工具选型参考,加速一人企业落地。
- 论文公开站arXiv
Affora:面向智能体友好界面的设计系统
Affora: A Design System for Agent-Friendly Interfaces
摘要显示,计算机使用智能体常需操作面向人类设计的软件,但界面往往无法向机器读者清晰传达操作或任务状态。作者提出 Affora 设计系统,旨在同时服务人类与智能体读者,并保留视觉自由度与熟悉的人机工作流。通过三项受控研究考察组件实现、视觉变化与交互设计原则,并给出从单个组件到完整站点的指南、可复用实现与可执行检查。评估显示,在 Affora 能弥补现有缺陷的独立界面上有提升,但在缺陷不存在或超出其覆盖范围时效果有限。
意义:为开发者提供兼顾人机双读者的界面设计规范与可执行检查,有助于降低智能体操作软件时的交互成本与歧义。
- 资讯公开站Semiconductor Engineering
常关型p-GaN HEMT的预测性TCAD建模:动态导通电阻、漏电、击穿及机器学习辅助设计探索
Predictive TCAD Modeling of Normally-Off p-GaN HEMTs for Dynamic RDS(on), Leakage, Breakdown, and ML-Based Design Exploration
摘要显示,该工作提出一套常关型p-GaN HEMT的预测性仿真工作流,重点涵盖器件物理校准、漏电建模、动态导通电阻(RDS(on))与击穿行为,并引入机器学习辅助的设计探索。原文未披露具体器件数据、模型精度或实验验证结果。
意义:为功率GaN器件的TCAD仿真与ML辅助设计提供可参考的方法框架,有助于缩短器件开发迭代周期。
- 论文公开站arXiv
ScienceBuddy:面向交互式科学智能体的递归自改进
ScienceBuddy: Recursive-in-Recursive Self-Improvement for Interactive Scientific Agents
摘要显示,ScienceBuddy 是一个交互式科研工作空间,将可持续改进的科学智能体嵌入研究者日常工作流,把研究者的请求、反馈与执行证据转化为任务和评估标准以支持持续学习。其核心为「递归中的递归」自我改进范式:内层递归在模型固定下改进 harness,外层递归在改进后的 harness 下训练模型,两者相互促进。案例研究覆盖四个科学任务族,并以研究产品形式开源发布。
意义:将 agent 脚手架演进与模型强化学习嵌套耦合,为持续自我改进型智能体提供了可复用的工程范式与开源产品参考。
- 资讯公开站Entrepreneur
自动化越多,企业越需要人性化领导力
The More You Automate, the More Your Business Needs Human Leadership. Here’s Why.
随着人工智能加速工作流程,最重要的领导者将是那些专注于技术无法替代的特质的人。摘要强调,在自动化程度不断提高的世界中,人性化领导力(如同理心、创造力和道德判断)变得愈发关键。企业需平衡效率与人性,以确保长期成功。
意义:提醒开发者和管理者:AI虽能提升效率,但领导力中的情感与道德层面不可替代,需重视人机协作中的平衡。
- 开源项目公开站GitHub
OpenHuman:你的个人AI超级智能,构建本地优先的生活记忆与智能体编排器
tinyhumansai/openhuman — Your Personal AI super intelligence. A brain that builds a local-first memory of your life, a fantastic orchestrator of agent fleets and workflows, and a deep researcher.
OpenHuman是一个开源项目,旨在打造个人AI超级智能。它构建本地优先的生活记忆,作为智能体舰队和工作流的编排器,并具备深度研究能力。项目在GitHub上获得约3.9万星标,受到开发者关注。
意义:该项目代表了个人AI助手向本地优先、智能体编排方向发展的趋势,对开发者构建自主AI系统具有参考价值。
- 资讯公开站Entrepreneur
AI正在改变企业的人才标准:系统思维成为关键技能
AI Is Changing What Companies Should Look for in Talent. Here’s the Skill That Matters Most Now.
摘要显示,随着AI的影响,企业招聘和培养人才时应更重视系统思维能力。具备这种能力的人才能构建更强大的工作流程、创造更多杠杆效应,并提升整体绩效标准。
意义:提示开发者和企业在AI时代需重视系统思维,以优化工作流和提升效能。
- 论文公开站arXiv
读取不等于使用:检索、判断与AI金融研究工作流的设计
Reading Is Not Using: Retrieval, Judgment, and the Design of AI Financial Research Workflows
摘要显示,大型语言模型在金融分析中的评估通常基于检索能力,而非检索信息对判断的影响。研究发现,在长上下文金融分析中存在“检索-整合缺口”:当无关上下文从2000增至128000个token时,风险披露对投资判断的影响降至噪声水平,尽管直接检索仍准确。该现象在多个模型家族和任务中复现,且更强大的模型仅推迟而非消除此缺口。因果记忆干预表明,压缩摘要和源文本查找共同传递披露信息,而工作流架构(如分块-总结流水线会逐出相关信息)决定传递成败。因…
意义:对AI行业而言,提示了仅靠检索评估的不足,强调工作流设计对模型实际决策的影响,为金融AI系统开发提供关键考量。
- 资讯公开站Entrepreneur
公司用AI不等于AI原生:关键在于工作设计、人员配置与衡量方式
Your Company Uses AI. That Doesn’t Make It AI-Native. Here’s the Difference.
摘要显示,AI原生与所使用的技术栈几乎无关,而关乎工作如何设计、人员如何配置以及绩效如何衡量。许多公司虽使用AI,但并未真正实现AI原生,因为其工作流程和衡量体系仍基于传统模式。AI原生意味着从工作设计、人员配置到衡量标准都深度融入AI逻辑。
意义:为企业及开发者提供AI转型的深度视角,强调AI原生不仅是技术应用,更是组织变革,指导企业避免表面化AI应用。
- 论文公开站arXiv
Prime Agent:一种自我改进的递归语言模型工具链
Prime Agent: A Self-Improving RLM Harness
Prime Agent是一个开源工具链,用于长时程评估和编码智能体工作流。它采用递归语言模型抽象,通过持久化IPython REPL进行程序化上下文处理,并持续保存历史、记忆、技能和子智能体配置。递归子智能体可直接通信,人类可通过代理视图监控会话。该工具标准化执行、恢复、验证和资源核算,将策略构建留给模型,防止工具链故障影响模型表现。在ARC-AGI-3上,其RHAE Best@1从30%提升至95.5%,并在多项任务上达到或超过其他主…
意义:提供标准化工具链,减少环境故障干扰,提升模型真实能力评估,对长时程智能体开发具有参考价值。
- 论文公开站arXiv
MidTool:面向智能体工具使用的中期训练数据合成
MidTool: Mid-training Data Synthesis for Agentic Tool Use
摘要显示,MidTool是一个用于智能体工具使用中期训练的开源语料构建流程,整合大规模网页、PDF和代码数据,并利用真实工具API、MCP技能和文档相关工作流合成监督信号。该流程旨在教会模型识别工具功能、从上下文获取参数、组合工具调用工作流并从不完整信息中恢复。在Qwen3-4B-Base和Qwen3-8B-Base上进行中期训练,并配合监督微调和强化学习,MidTool-Mix在BFCL、tau2-Bench和MCP Universe…
意义:为通用工具使用提供专门的中期训练方法,提升模型在真实工具调用场景中的能力,对智能体开发具有重要意义。
- 论文公开站arXiv
从计算机使用痕迹中归纳任务模型
Inducing Task Models from Computer-Use Traces
摘要介绍了一种名为任务模型归纳(TMI)的新方法,用于从自然计算机使用痕迹中提取符号化、可审计且可复用的任务模型。该方法能发现潜在任务并分离并发活动,为每个任务构建包含层级目标模型和程序模型的任务模型。在受控实验中,TMI在任务分组上与真实标签的一致性达0.974,重建了74.9%的执行步骤,远超现有基线。此外,基于TMI任务模型提取的技能将任务准确率提升了30.0%。
意义:对AI代理领域意义重大,为代理学习真实工作流程提供结构化方法,支持审计与知识重用,提升任务执行准确性。
- 论文公开站arXiv
基于智能体方法的活动数据收集、出行行为建模与天气敏感需求预测
An Agentic Approach for Active Data Collection, Travel Behavior Modeling, and Weather-Sensitive Demand Prediction
摘要显示,本研究提出一个三智能体工作流,整合对话式数据收集、结构化数据处理和行为预测。通过聊天机器人管理的图像增强陈述偏好调查,收集了454条学生通勤者在五种天气情景下的出行方式选择数据。使用多项逻辑模型分析天气关联,并以逻辑回归和随机森林作为机器学习基准。评估了九个本地部署的大语言模型,范围从2亿到350亿参数,在四种零样本提示条件下,并扩展了角色、少样本和视觉配置。最佳文本零样本LLM达到69.9%的准确率,而最佳视觉配置达到71.…
意义:该研究展示了大语言模型在出行行为预测中的潜力,并比较了不同提示策略的效果,为开发天气敏感的智能出行服务提供了新思路。