全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「去噪」共 11 条

  • 资讯公开站rss_arxiv_cs_ai

    喝杯咖啡:面向离散扩散的编译目标未来感知引导

    Grab a Coffee: Future-Aware Guidance for Discrete Diffusion with Compiled Objectives

    离散扩散模型通过并行迭代解析多个 token 来生成序列,为从左到右的生成方式提供了一种灵活替代方案。然而,用序列级目标引导这一过程十分困难,因为某个未解析 token 的价值取决于它能与之组成高奖励序列的其他 token。枚举所有此类补全会使整个引导计算量随未解析位置数量呈指数增长。我们提出 COFFEE,一个即插即用框架,通过将序列依赖与目标分离来避免这种枚举。在每个扩散步骤中,一个无目标载体吸收去噪器预测的边缘 token 分布,…

  • 论文公开站arXiv

    局部去噪的崩溃作为语义物种形成

    Breakdown of Local Denoising as Semantic Speciation

    生成模型动力学呈现两个看似不同的时间窗口:样本确定语义类别的物种形成窗口,以及局部上下文窗口不足以生成的非局域窗口。本文受二者近乎同步的证据启发展开研究。

  • 论文公开站arXiv

    PDMD:面向视频扩散模型的投影分布匹配蒸馏

    PDMD: Projected Distribution Matching Distillation for Video Diffusion Models

    现代视频扩散模型需在长时空Token序列上进行数十次去噪评估,分布匹配蒸馏(DMD)可将函数评估次数降至几次,但DMD样本在训练中会退化。

  • 论文公开站arXiv

    Rolling-WAM:带滚动想象的世界动作模型

    Rolling-WAM: World Action Models with Rolling Imagination

    摘要显示,世界动作模型(WAM)将动作生成与未来视觉预测耦合,但每个重规划周期都要完成完整的视频-动作联合去噪,带来显著延迟。Rolling-WAM 将联合去噪分散到连续的重规划周期中,用滑动窗口维护处于不同噪声水平的视频-动作块:每步完整去噪即将执行的动作块,同时部分精炼更远未来的块,并随新相机观测推进窗口。在 LIBERO、RoboTwin 与真实 Unitree G1 人形机器人上,摘要称其达到有竞争力的操作性能,并相较标准联合 …

    意义:为机器人操作中的视频-动作联合模型提供低延迟重规划思路,把计算摊到时间轴上,提升闭环响应速度。

  • 广告艾恩晟 2025早春美式宽松垂感牛仔阔腿裤深蓝色系慵懒风ins博主风淘宝好价/有券样本,适合对照券后价与规格再决定是否入手。淘宝¥159 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    WorldCrafter:具有隐式3D感知记忆的一致视频世界模型

    WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory

    摘要显示,WorldCrafter 是一种视频世界模型,学习可被相机查询的隐式3D感知记忆,让请求视角决定多视角证据如何压缩进视频生成器有限的 token 预算。记忆编码器与姿态条件读出模块同视频生成器联合训练,在去噪前将历史观测整合为固定数量的目标视角专属 token,无需显式深度对应。结合近期时序上下文与少步蒸馏,该模型支持从单张图像或文本提示进行流式场景探索,在静态与动态场景中提升了长时程一致性与相机控制精度。

    意义:为长时程、跨视角一致的交互式视频世界模型提供隐式3D记忆方案,利于场景探索与相机控制类应用。

  • 论文公开站arXiv

    λ控制GRPO:将流匹配比率不稳定性转化为预算资源

    $λ$-Controlled GRPO: Turning Flow-Matching Ratio Instability into a Budgeted Resource

    摘要显示,该研究针对流匹配模型强化学习(Flow-GRPO)中多步去噪训练不稳定的问题,指出重要性比率漂移、离散化、裁剪率差异等看似独立的失效模式实际源于单一的「路径方差」量,该量由采样器的高斯转移核精确决定并可低成本估计。作者提出 λ-Controlled GRPO,依据预测规律校准重要性比率行为,并按预测代价在去噪步间分配梯度预算,两个尺度由标准策略选择固定而非自由调参。在文本到图像模型上以 OCR 评分渲染难目标文本等两种奖励设置…

    意义:为流匹配生成模型的强化学习对齐提供了可度量、可预算的稳定性机制,减少对手工调参稳定器的依赖,对图像生成模型的 RL 训练工程有直接参考价值。

  • 论文公开站arXiv

    GeoAAC:VLA策略中基于去噪轨迹的几何自适应动作分块

    GeoAAC: Geometry-Based Adaptive Action Chunking from Denoising Trajectories in VLA Policies

    摘要显示,现有视觉-语言-动作(VLA)策略多采用固定动作时域,难以适应任务不同阶段对动作连续性、控制精度与闭环反馈的差异化需求。作者提出GeoAAC,利用Flow Matching去噪轨迹的几何信息刻画预测可靠性,发现动作前缀的几何变化与预测不确定性正相关,据此构建逐时域几何轮廓,在单次生成中自适应确定动作时域,无需额外训练。在GR00T N1.5与π0.5上、于LIBERO、LIBERO-Pro、RoboCasa365及真实操作任务…

    意义:为VLA策略提供免训练的自适应动作时域机制,提升长程操作任务的成功率与灵活性,对机器人策略部署有直接参考价值。

  • 论文公开站arXiv

    rMuscle:面向高效视觉-语言-动作模型推理的机器人肌肉记忆

    rMuscle: Robotic Muscle Memory for Efficient Vision-Language-Action Model Inference

    摘要显示,论文先刻画了具身智能工作负载,发现机器人在重复执行任务时,其观测、动作轨迹乃至内部模型状态都存在显著相似性。基于此提出 rMuscle 实时 VLA 推理框架,采用双阶段「肌肉记忆」缓存:上下文缓存复用视觉 token 输出以减少计算,动作缓存复用神经元激活模式以减少权重访问,并通过在线缓存重算、滑窗检索和去噪步骤间掩码共享控制开销。在 LIBERO、RoboTwin 及物理操作任务上,于 RTX 4090 与 Jetson …

    意义:为 VLA 机器人策略提供免重训练的推理加速思路,利用重复任务相似性降低延迟,对具身智能实时部署与边缘设备(如 Jetson Thor)有直接价值。

  • 广告艾恩晟 2026早春新款牛仔裤宽松阔腿裤八分九分裤 美式时髦潮淘宝好价/有券样本,适合对照券后价与规格再决定是否入手。淘宝¥159 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    模态自回归的世界-动作模型

    Modality-Autoregressive World-Action Models

    摘要显示,该工作提出 ModAR,一种先在预测动作前自回归式去噪多种未来模态的世界-动作模型(WAM),使每次预测都能以先前生成的模态为条件。研究从零训练,系统考察训练数据混合、预测模态与 WAM 形式对性能的影响。结果显示,预测点轨迹、DINO 特征与深度图对 WAM 有益,而额外预测 RGB 并无一致收益;ModAR 的序列生成优于现有 WAM 形式,并在所有评估数据规模下取得最高平均成功率。

    意义:为具身智能与世界模型提供新范式:用点轨迹、DINO 特征、深度等模态替代 RGB 预测,可能显著降低训练算力并提升策略成功率。

  • 论文公开站arXiv

    MDTE:面向时序边事件的少数类感知扩散框架用于不平衡节点分类

    MDTE: Minority-Aware Diffusion over Temporal Edge Events for Imbalanced Node Classification

    MDTE是一个针对时序图类别不平衡节点分类的少数类感知扩散框架,通过条件扩散去噪重建稳定且可区分的时序边事件表示。它包含分布感知选择性传播,利用LOF过滤和聚类感知低频传播缓解多数类信息同化;以及多视图判别融合,通过特征重建和拓扑预测提取互补判别信号。在五个真实数据集上,MDTE在少数类指标上优于最强基线,少数类召回率最高提升23.53个百分点。

    意义:为时序图上的类别不平衡问题提供了新思路,通过扩散模型和分布感知传播提升少数类识别能力,对异常检测和稀有事件预测等应用有重要价值。

  • 论文公开站arXiv

    均匀与重掩码离散扩散模型的自适应采样保证

    Provably adaptive sampling with uniform and remasking discrete diffusion models

    摘要显示,针对均匀前向过程的离散扩散模型,标准τ-leaping采样器的下界随维度d线性增长,但该研究提出一种基于留一法去噪器的一阶采样器,支持并行坐标更新,并能纠正采样中的去噪错误。主要结果建立了自适应采样保证:在忽略对数因子下,N = O(DTC(X0)/ε)步即可达到O(ε_score+ε)的采样误差,其中DTC为双总相关,表明采样复杂度由目标分布的内在结构而非维度决定。

    意义:该研究为离散扩散模型提供了更高效的采样方法,将采样复杂度与数据内在结构关联,有望提升高维生成任务的效率,对生成式AI的推理优化有重要意义。