- 论文公开站arXiv
Agent in a Bottle: Can LLM Agents Turn Their Capabilities Into Cheap, Scalable Artifacts?
Large language models (LLMs) can solve many narrow tasks, but querying them separately for millions of related instances can be prohibitively expensive. Can LLM agents autonomously create cheaper solutions for such workl…
- 论文公开站arXiv
Turbo Harness:实例自适应框架优化
Turbo Harness: Instance-Adaptive Harness Optimization
自动化搜索有效框架是实现智能体递归自我改进的重要一步。现有优化通常产出统一应用于所有任务的单一全局框架,但适用于某类任务的框架未必通用。
- 论文公开站arXiv
半事实信用增强策略优化
Semifactual Credit-Augmented Policy Optimization
可验证奖励强化学习(RLVR)提升了 LLM 推理能力,但其预测仍对任务无关的提示特征敏感。本文通过半事实提示干预研究这种敏感性。
- 论文公开站arXiv
思考之前先思考:通过元推理扩展智能体推理
Thinking Before Thinking: Scaling Agentic Inference Through Meta-Reasoning
随着智能体处理更长更复杂的问题,控制执行本身成为一项任务。本文提出智能体元推理,在运行中做出选择部分工作、是否重新开始或何时停止等控制决策。
- 论文公开站arXiv
PDMD:面向视频扩散模型的投影分布匹配蒸馏
PDMD: Projected Distribution Matching Distillation for Video Diffusion Models
现代视频扩散模型需在长时空Token序列上进行数十次去噪评估,分布匹配蒸馏(DMD)可将函数评估次数降至几次,但DMD样本在训练中会退化。
- 论文公开站arXiv
伸缩式语言模型
Telescopic Language Models
一个已部署的语言模型常需服务多种算力预算,而每个预算点仍需单独训练或压缩;本文训练伸缩式语言模型(TLM)作为连续体,由随机前缀监督的嵌套容量Transformer构成。
- 论文公开站arXiv
通过发现时间解释中的重复概念揭示音频分类器中的捷径学习
Uncovering shortcut learning in audio classifiers by discovering recurring concepts in temporal explanations
机器学习数据集中事件间的相关性可能导致捷径学习,模型基于相关事件的出现来预测目标事件。当这些相关性是虚假的(源于数据收集偏差)时,模型很可能学到错误关联。
- 论文公开站arXiv
ADPTNet:面向序列建模的自适应规定时间尺度非线性 SSM
ADPTNet: Adaptive with Prescriptive Timescales Non-Linear SSM for Sequence Modelling
神经形态计算的核心目标是提供高能耗 Transformer AI 的可行替代方案。然而,高效替代方案难以捕捉使 Transformer 成为序列建模事实标准的一系列特性。
- 资讯公开站Energy Storage News
BLUETTI 在 IFA 2026 发布面向工作、家庭与出行场景的新能源方案
BLUETTI Launches New Energy Solutions for Work, Home and Life on the Move at IFA 2026
摘要显示,清洁能源技术企业 BLUETTI 在 IFA 2026 上发布了一系列新产品与智能能源解决方案,覆盖工作、家庭以及移动生活等使用场景。原文未披露具体产品型号、规格参数或上市时间等信息。
意义:储能与便携电源厂商加速向智能能源生态延伸,开发者可关注其设备互联与家庭能源管理接口机会。
- 论文公开站arXiv
直接反馈对齐中的共模坍缩与恢复
Common-Mode Collapse and Recovery in Direct Feedback Alignment
摘要显示,直接反馈对齐(DFA)用固定随机投影回传输出误差训练隐藏层,在 tanh 隐单元与独立 sigmoid 输出下,普通 SGD 可能停滞在接近类别频率常数预测器的损失水平。作者将停滞归因于误差中的共模成分,通过精确的均值-协方差分解分离出由均值教学信号和均值突触前活动构成的秩一更新,其主成分推动 tanh 单元饱和。校准读出基线可抑制坍缩并加速学习。
意义:揭示固定随机反馈训练不稳定的共模机制,为对齐类算法与无反向传播训练的优化设计提供改进思路。
- 论文公开站arXiv
Gricea:面向对话式AI研究的开放科学平台
Gricea: An Open Science Platform for Conversational AI Research
摘要显示,对话式 AI(CAI)研究缺乏统一的系统与实验配置报告方式,阻碍复现与知识积累。作者提出 Gricea,一个将研究表示为可配置、可部署研究制品的开放科学平台,整合研究流程、被试界面与对话任务行为。在一项复现研究中,Gricea 复现了 CUI 2026 中 93% 符合条件的论文配置,同时指出 96% 论文存在阻碍忠实复现的信息缺失。用户研究显示不同背景研究者可成功构建可运行研究。
意义:为对话式 AI 研究提供可复现、可共享的实验基础设施,有助于缓解复现危机并推动累积式知识构建。
- 资讯公开站Electrek
SONDORS废弃三轮电动车原型现身eBay出售
SONDORS’ abandoned 3-wheeled electric car just showed up for sale on eBay
摘要显示,SONDORS 曾雄心勃勃推进的三轮电动车项目已遭放弃,其原型车近日出现在 eBay 上挂牌出售。该车被视为电动车行业「画饼」历史的实物遗迹,报道未披露售价、车况或卖家信息。
意义:对关注电动车创业与硬件量产风险的开发者而言,这是「概念车到量产」鸿沟的又一现实案例。
- 资讯公开站Semiconductor Engineering
芯片设计中的AI:从代码生成到EDA编排(爱丁堡大学)
AI in Chip Design: From Code Generation to EDA Orchestration (University of Edinburgh)
摘要显示,爱丁堡大学研究人员发表技术展望文章《LLMs in Digital EDA: A perspective on shifting roles from Generation to Orchestration》,提出三个层级角色:单次生成设计产物的Generator、优化输出的Agent等,揭示能力如何累积,并指出角色正从生成向编排转变。
意义:为LLM在芯片设计自动化中的角色演进提供框架,帮助开发者理解从代码生成到流程编排的技术路径。
- 资讯公开站nvidia_newsroom_rss
NVIDIA 在 IFA 2026 加速本地 AI 落地
Sparks Fly: NVIDIA Accelerates Local AI at IFA 2026
NVIDIA 与微软及合作伙伴在 IFA 2026 上联手,为 NVIDIA 硬件带来更快的本地推理与更易部署运行智能体的新工具,并推出紧凑型 RTX Spark 产品。
- 论文公开站arXiv
SPARCL:基于谱分解的解析持续学习方法
SPARCL: Spectral Partitioned Analytic Continual Learning
SPARCL是一种新的解析持续学习方法,通过将自相关矩阵分解为高能核心和残差部分,仅更新残差块,从而避免旧类特征谱干扰。实验表明,在CIFAR-100、CUB-200等数据集上,SPARCL显著缩小了与强表示匹配方法的差距,并与Fly-CL等方法互补。
意义:为持续学习提供新理论视角,简化更新过程,提升旧类稳定性,对类增量学习场景有实际应用价值。
- 论文公开站arXiv
从法规到实施:LLM辅助行业合规的关键评估
From Regulation to Implementation: A Critical Evaluation of LLM-Assisted Regulatory Compliance in Industry
欧盟在可持续发展和隐私法规方面处于领先地位,但合规文档如数字产品护照(DPP)和数据保护影响评估(DPIA)的创建面临挑战。工业数据格式异构且分散,DPIA缺乏标准化。研究提出使用LLM生成合规文档,但数据提取指令和法规模糊性对输出质量的影响未充分探讨。本文通过基准测试不同模型与人工创建的真实模式对比,评估了这些因素对LLM生成的合规工件质量和一致性的影响。
意义:为LLM在合规文档生成中的应用提供了关键评估,揭示了数据提取和法规模糊性对输出的影响,对开发可靠的合规自动化工具具有重要意义。
- 论文公开站arXiv
VIALS:生命科学视觉工件解读基准
VIALS: A Benchmark for Visual Interpretation of Artifacts in the Life Sciences
VIALS 是一个视觉问答基准,包含161个生物技术行业实验流程中常见的视觉工件解读任务,如凝胶电泳图、显微镜图像、质粒图谱等。研究发现,前沿视觉语言模型虽能流畅描述自然图像,却难以准确解读这些科学图像,反映出领域知识和特定视觉推理能力的不足。而具备相关专业知识的科学家则觉得这些任务简单。
意义:该基准揭示了当前视觉语言模型在专业科学领域的短板,对开发面向生命科学行业的AI工具具有重要指导意义,推动模型提升领域特定视觉推理能力。