全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「扩散模型」共 12 条

  • 资讯公开站rss_arxiv_cs_ai

    喝杯咖啡:面向离散扩散的编译目标未来感知引导

    Grab a Coffee: Future-Aware Guidance for Discrete Diffusion with Compiled Objectives

    离散扩散模型通过并行迭代解析多个 token 来生成序列,为从左到右的生成方式提供了一种灵活替代方案。然而,用序列级目标引导这一过程十分困难,因为某个未解析 token 的价值取决于它能与之组成高奖励序列的其他 token。枚举所有此类补全会使整个引导计算量随未解析位置数量呈指数增长。我们提出 COFFEE,一个即插即用框架,通过将序列依赖与目标分离来避免这种枚举。在每个扩散步骤中,一个无目标载体吸收去噪器预测的边缘 token 分布,…

  • 论文公开站arXiv

    打破同质化陷阱:通过SplitMoE扩展视频扩散模型

    Breaking the Uniformity Trap: Scaling Video Diffusion Model via SplitMoE

    受大语言模型启发的混合专家(MoE)是扩展视觉生成模型的有前景范式,但传统token级MoE在同类专家池中独立路由token并趋向均匀化,限制了性能。本文提出SplitMoE方法。

  • 论文公开站arXiv

    PDMD:面向视频扩散模型的投影分布匹配蒸馏

    PDMD: Projected Distribution Matching Distillation for Video Diffusion Models

    现代视频扩散模型需在长时空Token序列上进行数十次去噪评估,分布匹配蒸馏(DMD)可将函数评估次数降至几次,但DMD样本在训练中会退化。

  • 资讯公开站rss_arxiv_cs_ai

    蛋白质扩散模型测试时对齐的谱反馈方法

    Spectral Feedback for Test-Time Alignment of Protein Diffusion Models

    arXiv:2609.30456v1 公告类型:新 摘要:针对离散扩散模型的奖励最大化对齐方法主要聚焦于引导反向过程,或通过影响 token logits,或在中间步骤选择有利序列。这些方法在很大程度上将推理视为单向过程,缺乏重新审视不理想 token 选择的机制。我们提出谱反馈(Spectral Feedback),一种在反馈循环中选择编辑位置的算法,使模型能够迭代修正自身生成结果。该方法利用离散扩散模型的掩码结构,通过重新掩码和重新…

  • 广告361小白鞋男鞋运动鞋2026夏季新款透气冲孔鞋子空军一号百搭板鞋新款·淘宝·市场见相关商品上架/在售信号淘宝¥139.99 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    逆向扩散的一阶平稳性

    First-Order Stationarity of Reverse Diffusions

    摘要显示,该工作为扩散模型建立与优化理论对应的一阶理论:当正向过程(加噪过程)的平稳势函数强凸时,基于SDE的过阻尼与欠阻尼Langevin逆向流以显式指数速率收缩相对Fisher散度,而基于ODE的逆向过程不具备此性质;进一步纳入离散化后,为两类采样器给出平均一阶平稳性界,即非凸优化中平均梯度范数保证的采样类比。该无凸性证明是局部的,仅保证score一致性,不保证全局模式权重。

    意义:为扩散采样提供类优化收敛保证,有助于理解SDE与ODE逆向过程的差异及采样器的可验证收敛指标。

  • 论文公开站arXiv

    LiMA:通过异步扩散桥接长期想象与实时灵巧操作

    LiMA: Bridging Long-term Imagination to Real-time Dexterous Manipulation via Asynchronous Diffusion

    摘要显示,LiMA 是一种异步双系统生成框架,将意图规划与反应式执行解耦:慢系统负责稀疏的长时程时空意图生成,快系统负责稠密高频动作精修,并通过 Latent Schrödinger Bridge Coupling 机制对齐稀疏意图与稠密轨迹。论文称其相较 Cosmos-Policy 降低 45.8% 推理延迟,在六项双臂灵巧操作任务上总体成功率 70.8%、子任务平均成功率 78.9%,并在未见场景中保持性能。

    意义:为 VLA 与 World-Action Model 的推理延迟与反应速度矛盾提供异步分层思路,对实时机器人操作与具身智能系统架构有参考价值。

  • 论文公开站arXiv

    高维潜变量的可扩散性

    On the Diffusibility of High-Dimensional Latents

    摘要显示,表征自编码器(RAEs)让扩散模型能在预训练视觉编码器的特征空间中工作,但现成编码器为重建微调后会降低表征的有效维度。作者指出,在这种高维空间中使用流匹配的标准速度预测,会迫使模型拟合低维信号流形之外的正交噪声方向,导致优化低效;因此改用干净数据参数化(x0 预测),让学习聚焦于信号流形。多组强重建编码器实验显示,x0 预测一致提升文生图生成性能。

    意义:为在预训练编码器潜空间上做扩散/流匹配的开发者提供参数化选择依据:x0 预测可能比速度预测更高效、生成质量更好。

  • 论文公开站arXiv

    DexTacWAM:面向灵巧操作的视触觉世界-动作模型

    DexTacWAM: A Visuo-Tactile World-Action Model for Dexterous Manipulation

    摘要显示,DexTacWAM 是一种视触觉世界-动作模型(WAM),将各指尖触觉独立编码,经手指与姿态感知的触觉压缩器聚合后注入视频扩散世界模型,实现视触觉联合世界建模。在 22 自由度双臂平台的六项富接触灵巧操作任务中均取得最高分,平均 70.6,最强基线为 38.0。消融表明收益来自将接触演化纳入预测世界状态,而非仅做触觉条件化。

    意义:把触觉纳入世界模型而非仅作条件输入,为富接触机器人操作提供了新范式,对具身智能与多模态世界模型研究有直接参考价值。

  • 广告骆驼男鞋2026秋季新款板鞋经典轻盈透气运动休闲鞋百搭复古德训鞋有券·淘宝·市场见相关商品上架/在售信号淘宝¥369 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    Paint-Anything:图像生成与编辑的统一任意颜色控制

    Paint-Anything: Unified Any-Color Control for Image Generation and Editing

    摘要显示,该研究提出 Paint-Anything,通过对象级颜色监督学习共享的十六进制颜色提示接口,统一支持图像生成与编辑中的任意颜色控制。作者构建了 Paint-500K 数据管线(对象定位、感知颜色标注、编辑对合成),并用纯色锚点在噪声较高时间步补充监督。同时提出 ACBench 基准。在 FLUX.2-4B 上,ACBench-T2I 与 ACBench-Edit 分数分别提升 85.3% 和 28.3%。

    意义:为扩散模型提供更精确的对象级颜色控制与统一生成/编辑接口,并给出可复用的评测基准,利于设计与电商等可控生成应用。

  • 论文公开站arXiv

    MDTE:面向时序边事件的少数类感知扩散框架用于不平衡节点分类

    MDTE: Minority-Aware Diffusion over Temporal Edge Events for Imbalanced Node Classification

    MDTE是一个针对时序图类别不平衡节点分类的少数类感知扩散框架,通过条件扩散去噪重建稳定且可区分的时序边事件表示。它包含分布感知选择性传播,利用LOF过滤和聚类感知低频传播缓解多数类信息同化;以及多视图判别融合,通过特征重建和拓扑预测提取互补判别信号。在五个真实数据集上,MDTE在少数类指标上优于最强基线,少数类召回率最高提升23.53个百分点。

    意义:为时序图上的类别不平衡问题提供了新思路,通过扩散模型和分布感知传播提升少数类识别能力,对异常检测和稀有事件预测等应用有重要价值。

  • 论文公开站arXiv

    ConvergeFlow:具有可证明收敛到词元嵌入的语言流模型

    ConvergeFlow: Language Flow with Provable Convergence to Token Embeddings

    ConvergeFlow是一种基于嵌入空间的流式语言模型,将数据预测器限制在词元嵌入的凸包内,并仅使用流匹配的均方误差目标进行训练。在适当正则条件下,证明该流能收敛到有效词元嵌入,无需交叉熵解码器即可直接预测词元。实验表明其在OpenWebText上性能与现有连续和离散扩散模型相当。

    意义:该研究简化了连续语言模型的训练流程,无需交叉熵解码器,为流式语言建模提供了理论基础,可能提升生成效率与可控性。

  • 论文公开站arXiv

    均匀与重掩码离散扩散模型的自适应采样保证

    Provably adaptive sampling with uniform and remasking discrete diffusion models

    摘要显示,针对均匀前向过程的离散扩散模型,标准τ-leaping采样器的下界随维度d线性增长,但该研究提出一种基于留一法去噪器的一阶采样器,支持并行坐标更新,并能纠正采样中的去噪错误。主要结果建立了自适应采样保证:在忽略对数因子下,N = O(DTC(X0)/ε)步即可达到O(ε_score+ε)的采样误差,其中DTC为双总相关,表明采样复杂度由目标分布的内在结构而非维度决定。

    意义:该研究为离散扩散模型提供了更高效的采样方法,将采样复杂度与数据内在结构关联,有望提升高维生成任务的效率,对生成式AI的推理优化有重要意义。

  • 广告BEASTER民族纹样牛仔裤男23新品直筒宽松美式复古情侣蓝色长裤女新款·淘宝·市场见相关商品上架/在售信号淘宝¥369 · 精选自 全球电商每日爆款去看看