全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「训练」共 83 条

  • 论文公开站arXiv

    利用单一传感单元测量历史进行非定常流中的水下导航

    Underwater Navigation in Unsteady Flows Using Measurement Histories from a Single Sensing Unit

    摘要显示,研究提出一种因果观测器,仅凭单一传感单元的历史测量估计侧向流速,为固定导航控制器提供输入。在二维尾流仿真中,该虚拟传感接口将同步流场采样点从三个减少到机器人中心。仅在 Re=100 圆柱尾流上训练,未重新训练即在 Re=205 和 240 上分别达到 84.4% 和 80.6% 成功率,低于直接空间感知 7.4 和 4.6 个百分点,但显著优于仅当前流速观测器。

    意义:为水下机器人减少传感器数量、降低布局约束提供思路,并验证单点流场历史在闭环控制中的可用性。

  • 论文公开站arXiv

    扩展执行框架而非上下文:从无策略脚手架到可复用专家智能体

    Grow the Harness, Not the Context: From Strategy-Free Scaffolds to Reusable Specialist Agents

    摘要显示,该研究提出 Growing Harness 训练范式,从仅暴露固定模型与工具接口、不含任务求解控制器的无策略脚手架出发,利用函数级执行轨迹将失败定位到有限代码范围,由优化器联合修复一组失败,并以成功优先的留出集门控回滚有害修改,使控制结构从任务反馈中逐步涌现。在 BrowseComp-Plus 与 WebArena-Verified 及 4B 至 120B 三种模型上,六种设置中五种平均成功率最高,第六种落后最优 0.7 个百…

    意义:该工作把智能体控制逻辑沉淀为可复用代码而非反复填充上下文,显著降低调用次数与推理成本,并为小模型补齐长程任务能力提供新思路。

  • 论文公开站arXiv

    TM-APR:基于解析在线自适应的热成像时序记忆定位

    TM-APR: Thermal Temporal-Memory Localization via Analytic Online Adaptation

    摘要显示,该工作针对热成像视觉位置识别(Thermal VPR)在在线部署中面临的环境依赖强、在线重训练开销大、难以建模非线性漂移等问题,首次将解析类增量学习(ACIL)与域不变VPR结合,发现其无梯度矩阵更新可构成强基线,并进一步利用ACIL与现代控制理论的代数等价性,将无迹传播、高斯混合划分与极小极大H∞优化嵌入更新回路,实现O(1)复杂度的闭式矩阵更新,使在线学习延迟低于传感器采样间隔,从而避免实时SLAM轨迹跳变。

    意义:为热成像SLAM/VPR在线部署提供免反向传播、低延迟的域自适应更新思路,对实时机器人与边缘AI有参考价值。

  • 论文公开站arXiv

    SpeakerMem-R1:面向多方对话的以说话人为中心双轨记忆

    SpeakerMem-R1: Speaker-Centered Dual-Track Memory for Multi-Party Dialogue

    摘要显示,多方对话中的长期记忆需区分「谁说了什么」、涉及对象、个体认知、群体共享信息及状态随时间的变化。现有通用 LLM 记忆系统易丢失人物与群体关系,难以整合分散于成员、群体与时间中的线索。作者提出 SpeakerMem-R1,采用双轨记忆存储带说话人标注的原文消息与派生状态,并分人物级、群体级视图,查询时按实体、事件、时间融合两轨证据;同时用 SpeakerLevenshtein 与说话人条件化 GRPO 训练 Writer-R1 …

    意义:为多智能体与多方对话场景的长期记忆提供可归因、可本地部署的结构化方案,缓解人物关系丢失与状态重建难题。

  • 广告文创艺2027年新款日程本时间管理weekly周计划本商务高档记事本小随…新款·京东·市场见相关商品上架/在售信号京东¥24.75 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    一种带延迟信息共享的分散式部分可观测团队决策方法

    A Decentralized Partially Observable Team Decision Methodology with Delayed Information Sharing

    摘要显示,该研究针对具有低秩隐动态且系统模型未知的去中心化部分可观测团队决策问题,提出结合团队理论等价性与低秩模型表示的框架。团队成员仅依据本地私有信息与延迟共享的公共信息,各自学习近似低秩马尔可夫决策过程,并用最小二乘值迭代求解策略,无需集中式协调者或集中训练。文中证明成员侧解可逼近集中式团队最优策略,并给出有限样本性能保证与样本复杂度界。

    意义:为多智能体在通信受限、模型未知场景下提供去中心化学习与规划的理论保证,对分布式强化学习与协作决策系统有参考价值。

  • 论文公开站arXiv

    DreamStream:面向端到端驾驶的策略导向生成式仿真

    DreamStream: Towards Policy-Oriented Generative Simulation for End-to-End Driving

    摘要显示,现有仿真平台存在仿真到真实的视觉差距,会破坏策略感知,难以评估端到端驾驶策略的闭环决策。作者提出 DreamStream,一种基于仿真器接地的自回归视频模型构建的生成式闭环仿真器,通过交通布局引导从大型预训练视频模型蒸馏,在改变视觉外观的同时保留场景布局与动态物体时序一致性等策略相关特征。作者还指出 FID 等感知指标会误判特征保留程度,并提出多表示指标 FDπ。摘要称,在 FDπ 下 DreamStream 相比最强先前闭环…

    意义:为端到端自动驾驶提供更贴近策略感知的闭环仿真与评测指标,有望降低真实路测成本并暴露策略失效场景。

  • 论文公开站arXiv

    RRSI:智能体框架的正则化递归自我改进

    RRSI: Regularized Recursive Self-Improvement of Agent Harnesses

    摘要显示,LLM 智能体的能力很大程度上由其运行框架(提示、控制流、工具、记忆与上下文管理)放大,近期方法通过迭代提出并筛选框架组件的编辑来实现智能体系统层面的递归自我改进,但容易记忆训练任务、在分布外基准上增益消失。作者提出 RRSI,在候选提出与选择环节引入正则化:提出器采用时间退火预算并鼓励探索未走过的演化路径,选择器配备评论器与剪枝器过滤基准特定、过小、过贵或失效的改动。在编码、智能体工作区与工程设计等八个基准上,摘要称其在演化…

    意义:为智能体框架自动演化提供抗过拟合思路,提示开发者关注可复用机制而非基准特定调优。

  • 论文公开站arXiv

    Harness-Zero:以智能体为框架的框架蒸馏

    Harness-Zero: Harness Distillation via Agent-as-Harness

    论文提出「智能体外壳蒸馏」问题:将针对特定领域或实例优化过的外部外壳(harness)所诱导的行为迁移进模型权重,使收益在部署时固定单一外壳下仍能保留。作者提出 Harness-Zero,借助「智能体即外壳」机制,由受优化外壳引导的智能体在目标外壳动作空间中修正学生回答,形成训练示范,再经微调内化。实验覆盖知识工作、工具使用与科学领域,摘要显示在相同演化外壳下 agent-as-harness 优于 code-as-harness。

    意义:为智能体训练提供新范式:把外部外壳的优化收益固化进模型权重,减少对部署期专用外壳与路由的依赖。

  • 广告联想(Lenovo)YOGA Air14 Aura Ultra7新款设计…新款·京东·联想相关笔记本上架/在售信号京东¥9308 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    用于高效端侧LLM生成式个性化的LoRA生成超网络

    LoRA-generating hypernetworks for efficient on-device LLM generative personalization

    摘要显示,该论文提出一种设备端LLM个性化方法:训练超网络将用户上下文token映射为适合该用户的LoRA,部署后在设备端合成个性化LoRA。该方法结合了上下文学习(ICL)与参数高效微调(PEFT)的优点:设备端阶段仅需前向传播,计算可行;同时通过权重修改基础模型,避免扩展输入序列带来的延迟增加,尤其适合移动设备场景。

    意义:为移动端LLM个性化提供无需反向传播的可行路径,降低设备端算力与延迟门槛,对端侧AI应用开发有参考价值。

  • 论文公开站arXiv

    WorldCrafter:具有隐式3D感知记忆的一致视频世界模型

    WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory

    摘要显示,WorldCrafter 是一种视频世界模型,学习可被相机查询的隐式3D感知记忆,让请求视角决定多视角证据如何压缩进视频生成器有限的 token 预算。记忆编码器与姿态条件读出模块同视频生成器联合训练,在去噪前将历史观测整合为固定数量的目标视角专属 token,无需显式深度对应。结合近期时序上下文与少步蒸馏,该模型支持从单张图像或文本提示进行流式场景探索,在静态与动态场景中提升了长时程一致性与相机控制精度。

    意义:为长时程、跨视角一致的交互式视频世界模型提供隐式3D记忆方案,利于场景探索与相机控制类应用。

  • 论文公开站arXiv

    临界状态RL:诊断多轮工具使用中的可训练状态

    Critical-State RL: Diagnosing Trainable States for Multi-Turn Tool Use

    摘要显示,多轮工具调用失败常取决于单次模型调用,但仅靠奖励变化无法判断哪次调用值得训练,因为奖励可能反映后续随机性而非当前动作差异。作者提出 Critical-State RL,通过评估每次候选调用的局部奖励是否反映其对任务成功的贡献、以及相对参考策略是否存在改进空间,并用嵌套采样分离动作相关奖励变化与延续噪声,在选定状态上以上下文赌博机方式优化策略。在 BFCL v4 上,诊断选出的状态训练优于其他状态,missing-functio…

    意义:为多轮工具调用智能体提供一种定位关键可训练步骤的方法,有助于减少无效训练信号、提升 RL 微调效率。

  • 论文公开站arXiv

    λ控制GRPO:将流匹配比率不稳定性转化为预算资源

    $λ$-Controlled GRPO: Turning Flow-Matching Ratio Instability into a Budgeted Resource

    摘要显示,该研究针对流匹配模型强化学习(Flow-GRPO)中多步去噪训练不稳定的问题,指出重要性比率漂移、离散化、裁剪率差异等看似独立的失效模式实际源于单一的「路径方差」量,该量由采样器的高斯转移核精确决定并可低成本估计。作者提出 λ-Controlled GRPO,依据预测规律校准重要性比率行为,并按预测代价在去噪步间分配梯度预算,两个尺度由标准策略选择固定而非自由调参。在文本到图像模型上以 OCR 评分渲染难目标文本等两种奖励设置…

    意义:为流匹配生成模型的强化学习对齐提供了可度量、可预算的稳定性机制,减少对手工调参稳定器的依赖,对图像生成模型的 RL 训练工程有直接参考价值。

  • 广告莉齐在滴水 英文原版 LIZZIE DRIPPING 英文版儿童文学小说…新款·淘宝·市场见相关商品上架/在售信号淘宝¥57.5 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    粒子竞争与合作:标签噪声下鲁棒图卷积网络学习

    Particle Competition and Cooperation for Robust Graph Convolutional Network Learning Under Label Noise

    摘要显示,该工作提出PCC+GCN混合框架,在GCN训练前用粒子竞争与合作(PCC)作为基于图的标签精炼阶段,通过粒子支配动态识别可疑标注节点,并决定保留、删除或重新分配其标签;PCC所用图可加入特征k近邻边,而GCN仍在原始图结构上训练。在NoisyGL基准的十个图数据集上,常规均匀、Pair、随机噪声及实例相关噪声下,该方法取得最高平均准确率与最佳平均排名,较基线GCN平均提升1.67个百分点,并在十个数据集中八个上为最快鲁棒方法。

    意义:为标签噪声下的图神经网络训练提供即插即用的标签精炼前置模块,兼顾精度与速度,对噪声标注场景的GCN落地有参考价值。

  • 论文公开站arXiv

    BrainWideBench:多区域神经记录的大规模预训练与跨动物迁移基准

    BrainWideBench: Benchmarking large-scale pretraining and across-animal transfer in multi-region neural recordings

    摘要显示,该工作提出 BrainWideBench,用于评估多区域神经记录上的跨动物迁移能力,数据基于国际脑实验室 Brainwide Map,覆盖 139 只小鼠、276 个脑区。基准包含三类任务:行为解码、掩码或未来神经活动预测,以及解剖组织结构的恢复。结果显示预训练优于单会话基线,但迁移收益高度依赖预训练目标与下游任务的对齐程度,没有单一方法在全部任务上普遍最优。

    意义:为神经基础模型提供统一评测协议,提示开发者预训练目标需与下游任务对齐,而非追求通用表征。

  • 论文公开站arXiv

    CodeMidas:从代码本身扩展智能体编码RL环境

    CodeMidas: Scaling Agentic Coding RL Environments from Code Itself

    摘要显示,现有编码智能体 RL 环境多依赖 issue、commit 等开发痕迹,任务来源受限。CodeMidas 提出一种智能体流水线,仅以源代码为任务专属输入,将代码库中已实现的功能转化为可执行 RL 环境,通过智能体探索形成行为规格、基于原始代码执行构建测试,并经执行校验与多次解轨迹筛选任务。其数据集含来自 3,185 个开源代码库的 5,545 个训练任务,覆盖 23 种语言与 15 个技术领域。

    意义:为编码智能体 RL 训练提供低成本、可扩展的任务生成路径,降低对 issue/commit 等人工痕迹的依赖,利于开发者构建自有代码库训练环境。

  • 论文公开站arXiv

    SeeQ:为长时程机器人操作训练通用价值函数

    SeeQ: Training Generalist Value Functions for Long-Horizon Robotic Manipulation

    摘要显示,通用机器人策略在包含多阶段或需反复尝试的长时程任务上表现脆弱。SeeQ 提出学习当前活跃子任务的 Q 值,以缩短价值预测时程,从而可用时序差分目标有效训练;训练时利用离线机器人数据中的子任务标注,测试时由视觉-语言骨干自回归预测自然语言子任务再估值。在两种双臂机器人平台的四个真实操作任务上,该方法显著提升了 best-of-N 策略引导效果。

    意义:为长时程机器人操作提供可扩展的价值函数训练范式,降低稀疏奖励下的信用分配难度,对通用机器人策略与强化学习结合有参考价值。

  • 广告海外直订Lizzie and Lucky: The Mystery of…新款·淘宝·市场见相关商品上架/在售信号淘宝¥107.2 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    GeoAAC:VLA策略中基于去噪轨迹的几何自适应动作分块

    GeoAAC: Geometry-Based Adaptive Action Chunking from Denoising Trajectories in VLA Policies

    摘要显示,现有视觉-语言-动作(VLA)策略多采用固定动作时域,难以适应任务不同阶段对动作连续性、控制精度与闭环反馈的差异化需求。作者提出GeoAAC,利用Flow Matching去噪轨迹的几何信息刻画预测可靠性,发现动作前缀的几何变化与预测不确定性正相关,据此构建逐时域几何轮廓,在单次生成中自适应确定动作时域,无需额外训练。在GR00T N1.5与π0.5上、于LIBERO、LIBERO-Pro、RoboCasa365及真实操作任务…

    意义:为VLA策略提供免训练的自适应动作时域机制,提升长程操作任务的成功率与灵活性,对机器人策略部署有直接参考价值。

  • 论文公开站arXiv

    GPT模型中的危害洗白:性别歧视在安全训练中被转化而非减少

    Harm Laundering in GPT Models: Evidence That Gender Discrimination Is Transformed Rather Than Reduced Across Safety-Trained Generations

    摘要显示,研究分析GPT-2至GPT-5共15个模型、45万条性别指向生成内容,发现显性歧视内容在代际迭代中被转化而非移除,作者称之为「危害洗白」。GPT-2中针对女性的性暴力聚类在GPT-4后消失,但男性指向内容获得照护、情感表达等正向表征,女性指向内容则未获得。GPT-5中主题聚类将乳腺癌框定为男性权利议题,三个独立分类器均判其为非毒性;女性指向内容的主题多样性在GPT-4对齐边界相对男性下降36%。

    意义:提示仅靠表面毒性分类器评估安全对齐可能系统性漏检表征危害,开发者需引入主题多样性与表征危害指标。

  • 论文公开站arXiv

    RetireOPD:面向智能体强化学习的自退役在线策略蒸馏

    RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning

    摘要显示,多轮智能体强化学习仅提供轨迹级标量奖励,因此有研究采用自我在线策略蒸馏(OPD)从具备特权任务技能的自我教师处提供词元级稠密监督。但作者发现,特权信息并不总能让教师可靠,教师监督的收益也依赖训练阶段。为此提出 RetireOPD:先用环境奖励优化解耦的技能条件教师,再以 RL 与 OPD 联合训练无技能学生,并采用自适应退役机制——当学生与教师差距不再缩小且达到教师成功率目标比例时自行弃用教师,之后仅用 RL 训练。在 1.5…

    意义:为智能体强化学习提供了一种自适应蒸馏框架,避免教师监督在后期成为瓶颈,对训练多轮工具调用与任务型智能体有直接参考价值。

  • 论文公开站arXiv

    分数中心化稳定离策略强化学习

    Score Centering Stabilizes Off-policy Reinforcement Learning

    摘要显示,大语言模型强化学习对训练引擎与推理引擎之间的微小差异(训练-推理不匹配,TIM)高度敏感,而完全消除 TIM 会显著牺牲 rollout 效率。作者认为 TIM 下 RL 不稳定的主因是「漂移」——训练与推理引擎间随训练步数累积的持续偏差,并提出加性的「分数中心化」修正项来抵消漂移。在 0.6B 至 30B 参数模型上,该方法在量化条件下匹配或优于基于重要性采样的方法,且不匹配越严重优势越大;由于修正是加性的,它还能与重要性采…

    意义:为 LLM 强化学习训练中普遍存在的训练-推理引擎不一致问题提供了一种轻量、可组合的稳定性修正,有助于在不牺牲 rollout 效率的前提下提升大规模 RL 训练稳定性。

  • 广告OAK FAMILY春秋儿童长袖连衣裙全棉女宝碎花裙公主裙新款样本,适合先看规格与上架节奏再决定是否入手。淘宝¥298 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    分布偏移如何影响神经PDE代理模型的预训练收益?

    How Does Distribution Shift Shape Pretraining Gains in Neural PDE Surrogates?

    摘要显示,研究者在254,909个RANS解上预训练神经PDE代理模型,再在具有匹配来流范围的新翼型族上微调,比较相同SA模型与加入e^N转捩建模两种目标设定。结果显示,预训练收益取决于目标数据预算、目标数据覆盖度以及源域与目标域是否在建模物理上存在差异,且随样本量变化收益排序会反转。

    意义:为科学机器学习中预训练代理模型的迁移策略提供量化依据,提示开发者需根据目标数据量与物理差异权衡预训练收益。

  • 论文公开站arXiv

    工作空间模型:基于显著性驱动监督的轻量机器人记忆

    Workspace Models: Lightweight Robotic Memory via Saliency-Driven Supervision

    摘要显示,该论文提出「workspace token」表示,在训练阶段用 VLM 识别任务所需的当前与历史信息,并通过集合重建解码器损失蒸馏为轻量潜变量记忆,部署时可直接替代观测输入,无需在环 VLM 推理。仿真与硬件实验表明,该方法在记忆密集型任务上不仅更轻量,策略性能也更好。

    意义:为机器人策略记忆提供训练期蒸馏、部署期轻量化的思路,降低对 VLM 在线查询的算力依赖,利于实时长时程操作落地。

  • 论文公开站arXiv

    具备障碍感知测试框架的编码智能体用于安全机器人操作

    Coding Agents with an Obstacle-Aware Harness for Safe Robot Manipulation

    摘要显示,编码智能体在机器人操作中虽无需专门训练即可运行,但在安全约束下多数任务仍会碰撞障碍物。作者将操作分解为路径阶段与接触阶段,发现失败源于规划环节:模型缺乏避障路径概念、无法在路径失效时重新规划,也未意识到接触执行受同一约束限制。为此提出 SafeHarness,通过障碍感知的路径规划(将物体表示为边界框并生成候选路径点序列)让智能体预先规划并验证路径,从而优先考虑安全约束。

    意义:为机器人编码智能体引入显式安全约束与障碍感知规划框架,推动安全关键场景下的可靠部署。

  • 论文公开站arXiv

    rMuscle:面向高效视觉-语言-动作模型推理的机器人肌肉记忆

    rMuscle: Robotic Muscle Memory for Efficient Vision-Language-Action Model Inference

    摘要显示,论文先刻画了具身智能工作负载,发现机器人在重复执行任务时,其观测、动作轨迹乃至内部模型状态都存在显著相似性。基于此提出 rMuscle 实时 VLA 推理框架,采用双阶段「肌肉记忆」缓存:上下文缓存复用视觉 token 输出以减少计算,动作缓存复用神经元激活模式以减少权重访问,并通过在线缓存重算、滑窗检索和去噪步骤间掩码共享控制开销。在 LIBERO、RoboTwin 及物理操作任务上,于 RTX 4090 与 Jetson …

    意义:为 VLA 机器人策略提供免重训练的推理加速思路,利用重复任务相似性降低延迟,对具身智能实时部署与边缘设备(如 Jetson Thor)有直接价值。

  • 广告播26秋新品垂感无袖连衣裙女通勤轻熟风收腰绿色连衣裙DDT3LD6108有券新款样本,适合对照券后价与上架节奏再决定是否入手。淘宝¥998 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    模型增长、递归和边界算子如何影响缩放指数

    How Model Growth, Recursion, and Boundary Operators Influence Scaling Exponents

    摘要显示,该研究挑战了缩放定律中指数固定的传统认知,指出架构干预可改变预训练缩放指数,从而随算力增加带来指数级性能提升。作者以循环Transformer为锚点,发现模型增长(含是否共享权重)对缩放指数影响最大:7.4B增长架构在CORE上以约20倍更少算力匹配GPT-3 13B,且算力效率增益随规模增大。普通Transformer中加入边界算子也有较小增益;数据受限多轮训练下,循环具正则化效果,且随规模增加循环数为算力最优。

    意义:若缩放指数可被架构改变,则算力效率提升会随规模放大,为开发者提供超越单纯堆参数的新扩展路径。