- 论文公开站arXiv
打破同质化陷阱:通过SplitMoE扩展视频扩散模型
Breaking the Uniformity Trap: Scaling Video Diffusion Model via SplitMoE
受大语言模型启发的混合专家(MoE)是扩展视觉生成模型的有前景范式,但传统token级MoE在同类专家池中独立路由token并趋向均匀化,限制了性能。本文提出SplitMoE方法。
- 论文公开站arXiv
AdviSD:通过定向多轮自蒸馏学习指导前沿大模型
AdviSD: Learning to Advise Frontier LLMs via Targeted Multi-Turn Self-Distillation
小型可训练顾问可利用自然语言建议引导冻结的语言模型执行器。除任务奖励外,顾问还可利用已完成交互的反馈改进建议,但看似合理的纠正未必能改变执行结果。
- 论文公开站arXiv
学习元技能用于测试时AI4AI的智能体框架设计
Learning Meta-Skills for Agent Harness Design in Test-Time AI4AI
智能体性能取决于推理能力和所处环境。本文研究测试时AI-for-AI,探讨Builder如何在两个模型权重固定的情况下为Target构建更好的执行环境。
- 论文公开站arXiv
思考之前先思考:通过元推理扩展智能体推理
Thinking Before Thinking: Scaling Agentic Inference Through Meta-Reasoning
随着智能体处理更长更复杂的问题,控制执行本身成为一项任务。本文提出智能体元推理,在运行中做出选择部分工作、是否重新开始或何时停止等控制决策。
- 论文公开站arXiv
大模型图重建失真的谱理论:紧界与实证刻画
A Spectral Theory of Distortion in LLM Graph Reconstruction: Sharp Bounds and Empirical Characterization
语言模型图重建评估通常报告原始图与重建图之间的单一聚合距离。本文证明对于拉普拉斯谱间的Wasserstein距离,该汇总受两个边计数约束。
- 论文公开站arXiv
重新思考世界-动作建模的表征
Rethinking Representations for World-Action Modeling
世界-动作模型联合学习机器人策略并预测未来观测,使表征空间成为控制与预测的接口。本文通过受控比较研究该空间的设计,发现重建保真度和预训练均非关键。
- 论文公开站arXiv
Rho:高效可适应VLA模型的基础
Rho: A Foundation for Efficiently Adaptable VLA Models
通用物理AI模型须结合广泛视觉语言能力与跨机器人本体的精确控制及高效下游适应。本文提出Rho系列开放权重VLA模型,用于双臂操作,专为数据高效适应设计。
- 论文公开站arXiv
农田模式:并行维度注意力网络与数据集差异注意力用于作物分割
Cropland PAtteRNS: Parallel Dimensional Attention Networks and Attention to Dataset Disparity for Crop Segmentation in Satellite Imagery Time Series Data
卫星影像时间序列数据集和作物分割架构日益丰富,但在追求最新概念或最大数据集的过程中,两方面的重要事实被忽视。本文提出并行维度注意力网络及数据集差异注意力方法。
- 论文公开站arXiv
STEPQuant:Delta规则循环状态量化中误差何时何地重要
STEPQuant: When and Where Errors Matter in Delta-Rule Recurrent State Quantization
线性注意力用固定大小循环状态替代增长的KV缓存,但这些持久状态在并发服务下可能成为内存瓶颈。直接低精度量化循环状态常导致严重精度下降。本文提出STEPQuant。
- 论文公开站arXiv
反事实视频生成实现可扩展人形机器人移动操作
Counterfactual Video Generation Enables Scalable Humanoid Loco-Manipulation
通过视觉模仿教授人形机器人移动操作技能(如搬运多样物体)是通向通用机器人的有前景路径。但收集多样高质量交互视频(清晰展示人体全身和无遮挡交互)仍具挑战。
- 论文公开站arXiv
简化上下文机器人学习:面向操作任务的民主化方案
In-context Robot Learning Made Simple: A Democratized Recipe for Manipulation Tasks
本文研究机器人上下文学习(ICL),这一新兴范式使机器人能从视觉演示中推断并执行任务。尽管前景广阔,但问题本身仍定义不清:视觉演示同时传达动作轨迹和物体信息。
- 论文公开站arXiv
局部去噪的崩溃作为语义物种形成
Breakdown of Local Denoising as Semantic Speciation
生成模型动力学呈现两个看似不同的时间窗口:样本确定语义类别的物种形成窗口,以及局部上下文窗口不足以生成的非局域窗口。本文受二者近乎同步的证据启发展开研究。
- 论文公开站arXiv
技能空间射击用于自主机器人策略改进
Skill-Space Shooting for Autonomous Robot Policy Improvement
部署在物理世界的机器人须能在遇到新情况和失败时超越初始训练进行改进。为使改进跨任务扩展,须有效利用经验而无需人类演示每次纠正。
- 论文公开站arXiv
MINT:建模生成式AI对网络流量的影响
MINT: Modeling GenAI Impact on Network Traffic
生成式AI正成为主流网络负载,但数据包级模拟器缺乏基于实测的GenAI流量模型。目前研究人员只能用文件传输和视频流等传统来源近似GenAI服务,限制了真实性。
- 论文公开站arXiv
FinAutoRubric:专家引导的金融研究智能体自动评分标准生成
FinAutoRubric: Expert-Guided Automatic Rubric Generation for Evaluating Financial Research Agents
评估金融研究智能体需要反映专家标准并固定信息截止时点取值的评分标准。经专家评审的金融基准依赖固定的逐项评分标准,扩展成本高,且无法编码各机构自身的标准。
- 论文公开站arXiv
照搬相同,蒸馏差异:线性视觉Transformer的初始化
Copy the Same, Distill the Difference: Initializing Linear Vision Transformers
线性视觉Transformer(ViT)旨在用线性复杂度注意力算子替代Softmax ViT中的注意力,以实现更高效的token路由,但需要从头预训练,且通常性能不及原版Softmax。如何初始化是关键。
- 论文公开站arXiv
用自适应循环Transformer改进测试时扩展
Improving Test-Time Scaling with Adaptive Looped Transformers
循环Transformer通过复用层进行潜在计算,展现出良好的参数效率。此前研究在参数量或每token FLOPs匹配下比较循环与非循环模型,但循环是否改善测试时扩展尚不明确。
- 论文公开站arXiv
面向智能体强化学习高效压缩的KV-streams
KV-streams for Efficient Compaction in Agentic Reinforcement Learning
扩展智能体LLM的时域受限于需将越来越长的上下文轨迹装入GPU内存。上下文压缩是缓解该问题最常用的机制,可在给定轨迹下保持GPU内存恒定,但多数压缩策略存在不足。
- 论文公开站arXiv
如何循环MoE:展平专家,解绑注意力
How to Loop MoE: Flatten the Experts, Untie the Attention
循环Transformer多次复用同一层块:通过额外计算让固定规模模型走得更远,更充分利用参数;而稀疏混合专家(MoE)模型每个token只激活少数专家。循环MoE将两者结合。
- 论文公开站arXiv
神经调和测度算子
Neural Harmonic Measure Operator
我们提出神经调和测度算子(NHMO),一种用于变形状区域上椭圆偏微分方程问题的神经求解器。区域的调和测度是一种边界概率分布,与任意边界数据积分后即返回Dirichlet Laplace解。
- 论文公开站arXiv
复合自适应控制的收缩动力学表示统计学习
Statistical Learning of Contractive Dynamical Representations for Composite Adaptive Control
提出一种面向动态耦合扰动下复合自适应跟踪控制的表示学习框架,将经典扰动适应控制(DAC)与近期末层自适应扰动抑制方法联系起来。
- 论文公开站arXiv
TokenCast:预测LLM智能体执行中的Token消耗
TokenCast: Forecasting Token Consumption During LLM Agent Execution
同一任务下LLM智能体各次运行的Token消耗可相差一个数量级以上,因智能体依据工具反馈与中间结果选择下一步,且上下文不断膨胀推高输入规模。
- 论文公开站arXiv
DexRoam:从第一人称全身人类演示学习移动双臂灵巧操作
DexRoam: Learning Mobile Bimanual Dexterous Manipulation from Egocentric Whole-Body Human Demonstrations
移动双臂灵巧操作需在单条轨迹中协调运动、全身动作与手指级灵巧性,造成严重的机器人演示瓶颈;第一人称人类演示提供了可扩展的替代方案。
- 论文公开站arXiv
统一一步式视觉生成的分布训练
Unifying Distributional Training for One-Step Visual Generation
分布训练通过在冻结表示空间中匹配真实与生成特征,为一步式视觉生成提供集体监督;本文提出统一理论框架,将分布建模与匹配差异分离。
- 论文公开站arXiv
交错强化学习让统一模型学会原生反思
Learning Native Reflection in Unified Models with Interleaved Reinforcement Learning
统一多模态模型既能看图又能生成图,原则上可自我修复生成结果:诊断错误、修改、观察再诊断;但修改是否有益只有渲染后才能知晓。