- 论文公开站arXiv
Learning to Read the Contextual Tokens in Diffusion Transformers
Multimodal Diffusion Transformers (MM-DiTs) jointly process visual and textual representations throughout generation. These models repeatedly update the text tokens through multimodal attention, forming dynamic contextua…
- 论文公开站arXiv
Pivot-SD: Efficient Self-Distillation for Masked Diffusion Language Models
Masked diffusion language models (dLMs) offer a promising parallel alternative to autoregressive models for complex reasoning. However, they face a distinct credit-assignment challenge, since a few commitments during den…
- 论文公开站arXiv
RNADyn: A Benchmark for Generating and Understanding RNA Dynamics
Ribonucleic acid (RNA) functions through conformational changes that are not fully captured by static structures. However, large-scale standardized RNA dynamics data remain limited, and existing approaches typically trea…
- 论文公开站arXiv
Hierarchical Continuous Diffusion Language Models
Discrete diffusion language models offer a compelling alternative to autoregressive generation for tasks demanding bidirectional reasoning and global constraint satisfaction. Yet they share a structural bottleneck: when …
- 论文公开站arXiv
Embedding Prediction Helps Image Generation
In diffusion transformers, a class label or a text prompt is embedded once, and the same condition is reused at every denoising step. We ask whether predicted embeddings can serve as this condition instead. Next-Embeddin…
- 资讯公开站rss_arxiv_cs_ai
喝杯咖啡:面向离散扩散的编译目标未来感知引导
Grab a Coffee: Future-Aware Guidance for Discrete Diffusion with Compiled Objectives
离散扩散模型通过并行迭代解析多个 token 来生成序列,为从左到右的生成方式提供了一种灵活替代方案。然而,用序列级目标引导这一过程十分困难,因为某个未解析 token 的价值取决于它能与之组成高奖励序列的其他 token。枚举所有此类补全会使整个引导计算量随未解析位置数量呈指数增长。我们提出 COFFEE,一个即插即用框架,通过将序列依赖与目标分离来避免这种枚举。在每个扩散步骤中,一个无目标载体吸收去噪器预测的边缘 token 分布,…
- 论文公开站arXiv
打破同质化陷阱:通过SplitMoE扩展视频扩散模型
Breaking the Uniformity Trap: Scaling Video Diffusion Model via SplitMoE
受大语言模型启发的混合专家(MoE)是扩展视觉生成模型的有前景范式,但传统token级MoE在同类专家池中独立路由token并趋向均匀化,限制了性能。本文提出SplitMoE方法。
- 论文公开站arXiv
局部去噪的崩溃作为语义物种形成
Breakdown of Local Denoising as Semantic Speciation
生成模型动力学呈现两个看似不同的时间窗口:样本确定语义类别的物种形成窗口,以及局部上下文窗口不足以生成的非局域窗口。本文受二者近乎同步的证据启发展开研究。
- 论文公开站arXiv
PDMD:面向视频扩散模型的投影分布匹配蒸馏
PDMD: Projected Distribution Matching Distillation for Video Diffusion Models
现代视频扩散模型需在长时空Token序列上进行数十次去噪评估,分布匹配蒸馏(DMD)可将函数评估次数降至几次,但DMD样本在训练中会退化。
- 论文公开站arXiv
Rolling-WAM:带滚动想象的世界动作模型
Rolling-WAM: World Action Models with Rolling Imagination
摘要显示,世界动作模型(WAM)将动作生成与未来视觉预测耦合,但每个重规划周期都要完成完整的视频-动作联合去噪,带来显著延迟。Rolling-WAM 将联合去噪分散到连续的重规划周期中,用滑动窗口维护处于不同噪声水平的视频-动作块:每步完整去噪即将执行的动作块,同时部分精炼更远未来的块,并随新相机观测推进窗口。在 LIBERO、RoboTwin 与真实 Unitree G1 人形机器人上,摘要称其达到有竞争力的操作性能,并相较标准联合 …
意义:为机器人操作中的视频-动作联合模型提供低延迟重规划思路,把计算摊到时间轴上,提升闭环响应速度。
- 论文公开站arXiv
λ控制GRPO:将流匹配比率不稳定性转化为预算资源
$λ$-Controlled GRPO: Turning Flow-Matching Ratio Instability into a Budgeted Resource
摘要显示,该研究针对流匹配模型强化学习(Flow-GRPO)中多步去噪训练不稳定的问题,指出重要性比率漂移、离散化、裁剪率差异等看似独立的失效模式实际源于单一的「路径方差」量,该量由采样器的高斯转移核精确决定并可低成本估计。作者提出 λ-Controlled GRPO,依据预测规律校准重要性比率行为,并按预测代价在去噪步间分配梯度预算,两个尺度由标准策略选择固定而非自由调参。在文本到图像模型上以 OCR 评分渲染难目标文本等两种奖励设置…
意义:为流匹配生成模型的强化学习对齐提供了可度量、可预算的稳定性机制,减少对手工调参稳定器的依赖,对图像生成模型的 RL 训练工程有直接参考价值。
- 论文公开站arXiv
GeoAAC:VLA策略中基于去噪轨迹的几何自适应动作分块
GeoAAC: Geometry-Based Adaptive Action Chunking from Denoising Trajectories in VLA Policies
摘要显示,现有视觉-语言-动作(VLA)策略多采用固定动作时域,难以适应任务不同阶段对动作连续性、控制精度与闭环反馈的差异化需求。作者提出GeoAAC,利用Flow Matching去噪轨迹的几何信息刻画预测可靠性,发现动作前缀的几何变化与预测不确定性正相关,据此构建逐时域几何轮廓,在单次生成中自适应确定动作时域,无需额外训练。在GR00T N1.5与π0.5上、于LIBERO、LIBERO-Pro、RoboCasa365及真实操作任务…
意义:为VLA策略提供免训练的自适应动作时域机制,提升长程操作任务的成功率与灵活性,对机器人策略部署有直接参考价值。
- 论文公开站arXiv
模态自回归的世界-动作模型
Modality-Autoregressive World-Action Models
摘要显示,该工作提出 ModAR,一种先在预测动作前自回归式去噪多种未来模态的世界-动作模型(WAM),使每次预测都能以先前生成的模态为条件。研究从零训练,系统考察训练数据混合、预测模态与 WAM 形式对性能的影响。结果显示,预测点轨迹、DINO 特征与深度图对 WAM 有益,而额外预测 RGB 并无一致收益;ModAR 的序列生成优于现有 WAM 形式,并在所有评估数据规模下取得最高平均成功率。
意义:为具身智能与世界模型提供新范式:用点轨迹、DINO 特征、深度等模态替代 RGB 预测,可能显著降低训练算力并提升策略成功率。
- 开源项目公开站GitHub
octokit/octokit.js — 全功能内置的 GitHub SDK,支持浏览器、Node.js 和 Deno
octokit/octokit.js — The all-batteries-included GitHub SDK for Browsers, Node.js, and Deno.
Octokit.js 是一个“全功能内置”的 GitHub SDK,支持在浏览器、Node.js 和 Deno 环境中使用,用于以统一方式调用 GitHub API。该项目在 GitHub 上获得约 7847 颗星,属于 Octokit 官方组织下的 JavaScript 客户端库,定位是开箱即用、跨运行时的 GitHub 集成开发工具。
意义:为开发者提供跨运行时统一调用 GitHub API 的官方 SDK,降低集成与自动化开发成本。
- 论文公开站arXiv
MDTE:面向时序边事件的少数类感知扩散框架用于不平衡节点分类
MDTE: Minority-Aware Diffusion over Temporal Edge Events for Imbalanced Node Classification
MDTE是一个针对时序图类别不平衡节点分类的少数类感知扩散框架,通过条件扩散去噪重建稳定且可区分的时序边事件表示。它包含分布感知选择性传播,利用LOF过滤和聚类感知低频传播缓解多数类信息同化;以及多视图判别融合,通过特征重建和拓扑预测提取互补判别信号。在五个真实数据集上,MDTE在少数类指标上优于最强基线,少数类召回率最高提升23.53个百分点。
意义:为时序图上的类别不平衡问题提供了新思路,通过扩散模型和分布感知传播提升少数类识别能力,对异常检测和稀有事件预测等应用有重要价值。
- 论文公开站arXiv
均匀与重掩码离散扩散模型的自适应采样保证
Provably adaptive sampling with uniform and remasking discrete diffusion models
摘要显示,针对均匀前向过程的离散扩散模型,标准τ-leaping采样器的下界随维度d线性增长,但该研究提出一种基于留一法去噪器的一阶采样器,支持并行坐标更新,并能纠正采样中的去噪错误。主要结果建立了自适应采样保证:在忽略对数因子下,N = O(DTC(X0)/ε)步即可达到O(ε_score+ε)的采样误差,其中DTC为双总相关,表明采样复杂度由目标分布的内在结构而非维度决定。
意义:该研究为离散扩散模型提供了更高效的采样方法,将采样复杂度与数据内在结构关联,有望提升高维生成任务的效率,对生成式AI的推理优化有重要意义。