- 论文公开站arXiv
Turbo Harness:实例自适应框架优化
Turbo Harness: Instance-Adaptive Harness Optimization
自动化搜索有效框架是实现智能体递归自我改进的重要一步。现有优化通常产出统一应用于所有任务的单一全局框架,但适用于某类任务的框架未必通用。
- 论文公开站arXiv
半事实信用增强策略优化
Semifactual Credit-Augmented Policy Optimization
可验证奖励强化学习(RLVR)提升了 LLM 推理能力,但其预测仍对任务无关的提示特征敏感。本文通过半事实提示干预研究这种敏感性。
- 论文公开站arXiv
面向多模态临床诊断的排序感知提示优化
Ranking-Aware Prompt Optimization for Multimodal Clinical Diagnosis
多模态大模型正快速推进临床诊断,但其适配流程仍以准确率为目标。临床数据类别严重不平衡,恒定多数类预测器准确率可超90%却无临床价值。
- 资讯公开站rss_arxiv_cs_ai
GeoWind2Plan:面向节能无人机规划的任务时3D城市风场预测
GeoWind2Plan: Mission-Time 3D Urban Wind Prediction for Energy-Efficient UAV Planning
在城市低空飞行中,建筑物将环境风重塑为空间变化的三维流场,使无人机(UAV)能耗不仅取决于路径长度,还取决于局部风暴露。然而,当任务必须规划时,建筑物分辨率的风场信息往往不可用。计算流体力学(CFD)可生成高保真城市流场,但每次仿真都绑定于固定的来流边界条件,且可能耗时数小时至数天,这与通常仅持续数分钟到数十分钟的城市无人机任务不兼容。我们提出 GeoWind2Plan,一个用于任务时三维城市风场预测与节能无人机规划的“几何—风场—规划…
- 资讯公开站rss_arxiv_cs_ai
经验时代的自发现强化学习:学习历史是资产还是负担?
Self-discovering RL in the Era of Experience: Is Learning History an Asset or a Burden?
arXiv:2609.35897v1 公告类型:新 摘要:通往通用智能的递归自我改进(RSI)研究分为两条路线:宏观层面的语言模型扩展,以及“经验时代”中由交互驱动的原则。然而,任何自我改进架构最终都依赖于其底层优化引擎:如果通用智能需要从有根基的交互中学习,那么强化学习(RL)更新规则本身就必须具备累积适应能力。尽管算法自发现已产生 Disco103,其超越了 PPO 并达到 SOTA 基准表现,但其内部更新机制仍是一个未被审视的黑箱…
- 资讯公开站rss_arxiv_cs_ai
有效的大语言模型微调是否必须依赖人类可读文本?
Is Human-Readable Text Necessary for Effective LLM Fine-Tuning?
arXiv:2609.35868v1 公告类型:新 摘要:有效微调大语言模型是否必须依赖人类可读性?我们研究模型条件化的训练表示能否在无需人类可读文本形式的情况下保持或提升适配效用。我们提出 Desired-Update-Aligned Synthetic Data(DASA),利用冻结参考模型的激活梯度反馈来指导连续合成输入嵌入的优化。受激活梯度在局部风险降低中作用的启发,DASA 针对有用的适配更新,而非源文本重建或语言流畅性。所得…
- 资讯公开站Digitimes
DIGITIMES Insight:AI正成为移动通信行业新增长锚点
DIGITIMES Insight: AI is emerging as the new growth anchor in the mobile communications industry
韩国领先电信运营商SK电讯近期接连成立SK Hyper和SK Horizon,标志着电信AI的关键转变,从内部运营优化迈向全面基础设施化。
- 资讯公开站Digitimes
大连化工与Air Water联手拓展台湾半导体材料业务
Grand Pacific Petrochemical, Air Water join forces to expand Taiwan semiconductor materials business
台湾化工制造商大连化工在油价高企和全球贸易格局重塑背景下,优化核心业务并积极拓展高科技及半导体材料产业。公司总裁表示将与日本Air Water合作扩大相关业务。
- 资讯公开站Energy Storage News
优化美国BESS市场:Caerus Commodities的洞见
Optimising US BESS markets: Insights from Caerus Commodities
Caerus Commodities创始合伙人Casey Keller分享电池储能优化的关键经验,2026年美国电池资产管理峰会将于9月15-16日在加州举行。
- 资讯公开站Energy Storage News
Habitat Energy 获任优化 Octopus Australia 614MWh 光储项目
Habitat Energy appointed to optimise DC-coupled 614MWh solar-plus-storage portfolio for Octopus Australia
- 资讯公开站Energy Storage News
Greenvolt 在波兰投运 200MW/800MWh 容量市场签约 BESS
Greenvolt inaugurates 200MW/800MWh capacity market-contracted BESS in Poland
Greenvolt Power 在波兰投运了 200MW 的 Turośń Kościelna 电池储能设施,将由能源交易商 Entrix 进行优化。
- 资讯公开站rss_arxiv_cs_ai
通过嵌入式编码改进大语言模型的医学计算能力
Improving Medical Calculation of LLMs with Embedded Coding
arXiv:2609.31908v1 公告类型:新 摘要:大语言模型(LLM)在医学考试和问答基准上表现良好,但在需要精确数值输出的医学计算任务上仍不可靠。这些计算支撑着用药剂量、器官功能评估和预后评分等高风险决策,即使很小的误差也可能带来严重的临床后果。我们提出 MedCode,一个通过训练 LLM 生成嵌入式可执行代码来改进医学计算的框架。给定临床情境,模型识别相关计算器,提取其输入变量,并生成一段将算术运算委托给确定性解释器的脚本…
- 资讯公开站rss_arxiv_cs_ai
面向昂贵进化优化的排名可靠教师引导适应度近似:一项TinyML架构搜索研究
Rank-Reliable Teacher-Guided Fitness Approximation for Expensive Evolutionary Optimization: A TinyML Architecture Search Study
arXiv:2609.30553v1 公告类型:新 摘要:昂贵的进化搜索并不总是需要对每个候选个体进行精确的适应度估计。它往往只需要对一个更简单的问题给出可靠答案:哪个候选个体更好?我们通过教师引导学习NSGA-II(TGL-NSGA-II)来满足这一需求,这是一个用于带约束的微型机器学习(TinyML)神经网络架构搜索的低保真框架。一个预训练教师将样本组织为由难度和类别共同定义的分层。随后,每个候选个体都要经过KD-Lite,即在紧凑…
- 资讯公开站Energy Storage News
德国BESS项目如何具备可融资性?贷款方与业主在储能峰会上探讨
What makes a German BESS project bankable? Lenders, owners weigh in at Energy Storage Summit Germany
- 资讯公开站Energy Storage News
英国综述:Field、Eelpower与EDF的储能规划审批、收购及优化交易
UK ROUNDUP: BESS planning approvals, acquisitions and optimisation deals with Field, Eelpower & EDF
本期简讯汇总英国电池储能市场动态,涉及Field、Eelpower和EDF,由Solar Power Portal同事报道。
- 资讯公开站Energy Storage News
OptiGrid 将为 Vena Energy 澳洲 408MW Bellambi Heights 储能项目提供优化服务
OptiGrid to optimise Vena Energy’s 408MW Bellambi Heights BESS in Australia
摘要显示,Vena Energy 已选定 OptiGrid,为其位于澳大利亚的 408MW Bellambi Heights 电池储能系统(BESS)提供交易优化服务。该消息未披露交易金额、服务期限或项目投运时间等细节。
意义:储能项目通过第三方交易优化提升电力市场收益,反映澳大利亚大储商业模式向市场化运营演进。
- 资讯公开站Semiconductor Engineering
单一基板不再通吃一切
One Substrate No Longer Rules Them All
摘要显示,半导体工程文章指出,随着封装尺寸增大、布线精度提升以及功能嵌入需求增加,先进基板正从通用化设计转向针对特定应用的定制化方案,单一基板不再能覆盖所有场景。
意义:对芯片设计与封装开发者而言,意味着需更早考虑基板定制,推动设计与制造协同优化。
- 论文公开站arXiv
OC-GS:面向不规则转台拍摄的高斯泼溅重建
OC-GS: Gaussian Splatting for Irregular Turntable Capture
摘要显示,针对转台拍摄中旋转不均与丢帧导致等角度假设失效的问题,OC-GS 提出以物体为中心的高斯泼溅方法,在共享相机、旋转轴与枢轴的前提下细化每张图像的拍摄角度,联合优化图像几何与角度。在 12、8、6 个不规则视角下,前景 PSNR 分别为 21.26、19.36、15.83dB,均优于四个无位姿高斯泼溅基线;共享训练器下细化角度比固定估计提升 7.88dB,真实拍摄提升 0.70dB。
意义:为稀疏、不规则转台拍摄提供无需精确位姿的三维重建思路,对低成本物体扫描与高斯泼溅应用有参考价值。
- 论文公开站arXiv
面向编程代理的紧凑文档:基准、优化器及为何无法迁移
Compact Documentation for Coding Agents: A Benchmark, an Optimizer, and Why It Does Not Transfer
摘要显示,研究者构建了一个往返基准,用「由描述重新生成的代码能否通过原测试」来评分代码描述质量,发现完整性而非长度决定描述保真度;并据此优化出可泛化到未见文件的描述生成提示。但跨两个模型家族、十个仓库的测试表明,在源码存在时,静态紧凑文档或检索上下文均无法帮助代理解决真实仓库问题,作者将此负面结果连同基准与优化器一并报告。
意义:提示开发者:为编码代理生成文档未必提升真实任务表现,评估代理上下文策略需谨慎,避免无效投入。
- 论文公开站arXiv
直接反馈对齐中的共模坍缩与恢复
Common-Mode Collapse and Recovery in Direct Feedback Alignment
摘要显示,直接反馈对齐(DFA)用固定随机投影回传输出误差训练隐藏层,在 tanh 隐单元与独立 sigmoid 输出下,普通 SGD 可能停滞在接近类别频率常数预测器的损失水平。作者将停滞归因于误差中的共模成分,通过精确的均值-协方差分解分离出由均值教学信号和均值突触前活动构成的秩一更新,其主成分推动 tanh 单元饱和。校准读出基线可抑制坍缩并加速学习。
意义:揭示固定随机反馈训练不稳定的共模机制,为对齐类算法与无反向传播训练的优化设计提供改进思路。
- 论文公开站arXiv
逆向扩散的一阶平稳性
First-Order Stationarity of Reverse Diffusions
摘要显示,该工作为扩散模型建立与优化理论对应的一阶理论:当正向过程(加噪过程)的平稳势函数强凸时,基于SDE的过阻尼与欠阻尼Langevin逆向流以显式指数速率收缩相对Fisher散度,而基于ODE的逆向过程不具备此性质;进一步纳入离散化后,为两类采样器给出平均一阶平稳性界,即非凸优化中平均梯度范数保证的采样类比。该无凸性证明是局部的,仅保证score一致性,不保证全局模式权重。
意义:为扩散采样提供类优化收敛保证,有助于理解SDE与ODE逆向过程的差异及采样器的可验证收敛指标。
- 论文公开站arXiv
学会停止而无需学会停止:自监督置信度训练提升推理效率
Learning to Stop without Learning to Stop: Self-Supervised Confidence Training Improves Reasoning Efficiency
摘要显示,该研究提出一种自监督置信度微调方法:让推理模型在自身推理轨迹的中间点预测对答案的置信度,训练仅用600道题,损失函数不含长度、效率或停止目标,推理时也不做置信度引导或早停。在Gemma、Qwen、Nemotron、GPT-OSS等模型及数学、科学、代码基准上,生成token最多减少25%且准确率持平,效果与显式优化短推理的方法相当,并基本保留原有高层推理结构。
意义:为推理模型提效提供新监督信号:无需改推理流程或加长度惩罚,即可在保持准确率的同时显著降低推理成本。
- 资讯公开站Entrepreneur
Airbnb CEO 曾深陷会议泥潭,自建 AI「大脑」将会议减半
Airbnb’s CEO Was Drowning in Meetings. Then He Built an AI ‘Brain’ That Cut Them in Half.
摘要显示,Airbnb CEO Brian Chesky 曾因会议过多不堪重负,随后借助 AI 技术构建了一个「大脑」工具,将会议时间削减了一半。报道将其描述为一位 CEO 应对常见管理困境的技术尝试,但未披露该工具的具体实现细节或数据来源。
意义:展示企业高管用 AI 优化内部流程的实践案例,为 AI 办公与会议管理工具提供参考。
- 论文公开站arXiv
语言模型的最小侵入式引导
Minimally Invasive Steering of Language Models
论文提出 MISVO(最小侵入式转向向量优化),在冻结语言模型的最终隐藏状态上加入向量以实现测试时奖励适配,并用诱导 token 分布的局部 KL 几何对干预进行惩罚。该 Fisher 二次型可通过与冻结语言模型 head 的矩阵-向量乘积解析求梯度,作者还给出序列级 KL 梯度分解。在约 1B–14B 参数模型的偏好与代码生成任务中,MISVO 在 7 个模型-任务设置中的 6 个取得最高平均奖励,多样性与连贯性接近 Best-of-…
意义:为冻结模型提供无需更新参数、更少损伤生成质量的测试时对齐方法,降低微调成本。
- 论文公开站arXiv
RAPID:从演示中进行机器人智能体编程
RAPID: Robot Agentic Programming from Demonstrations
摘要显示,RAPID 面向机器人系统提出「从演示进行机器人智能体编程」方法,仅凭一次视觉人类演示,即可自动生成、验证并迭代优化机器人程序。其智能体循环依赖可测试任务规范、动作原语与可交互执行验证环境,三者均由演示自动推断。RAPID 采用以物体为中心的关系式程序表示,将动作原语表达为实现物体级运动效果的轨迹优化程序,并通过关系约束在运行时组合,从而提升跨物体位姿、形状、材质与环境的泛化能力。
意义:该方法把编码智能体的自动验证与迭代能力引入机器人编程,降低示教门槛,并为可复用、可泛化的机器人技能生成提供新范式。