- 论文公开站arXiv
4D-HOF: Hand-Object Flow Matching for Feed-Forward 4D Interaction Reconstruction
Existing methods for 4D hand-object reconstruction often rely on costly per-sequence optimization, while generative approaches typically synthesize interactions from random noise, which can lead to unstable interaction p…
- 论文公开站arXiv
Conformal Prediction Sets Quantify Information Gain: A Theoretical Perspective
Conformal prediction is a popular tool for uncertainty quantification that outputs prediction sets with finite-sample coverage guarantees. While prediction set size is commonly used as a heuristic measure of uncertainty,…
- 论文公开站arXiv
Planning to Learn
Policy-gradient methods are central to modern reinforcement learning, including LLM post-training. When they struggle, the usual suspects are exploration, credit assignment and action-sampling noise. Classification has n…
- 论文公开站arXiv
FrugalEvo: Towards Cost-Aware LLM-Guided Program Evolution
LLM-guided evolutionary methods, such as AlphaEvolve, have emerged as powerful approaches for challenging computational optimization problems, such as circle packing. However, prior work typically optimizes performance g…
- 论文公开站arXiv
ScholarCatalyst: A Benchmark for Retrieving Papers That Inspire New Research
What makes great scientists great? Even as AI systems start to make progress on open problems, scientists remain far ahead of them at sensing which prior idea, buried in an ever-growing archive of research, a new problem…
- 论文公开站arXiv
Scaling Laws for Looped Mixture of Experts
Looped transformers and Mixture-of-Experts (MoE) offer complementary routes to efficient scaling: recurrence increases computational depth at fixed parameters, while MoE sparsity expands total capacity at fixed active co…
- 论文公开站arXiv
ViTeX-Bench:高保真视频场景文本编辑基准
ViTeX-Bench: Benchmarking High-Fidelity Video Scene Text Editing
视频生成日益逼真可控,但视频编辑仍欠成熟,尤其是需保持原始场景动态的精确局部编辑。视频场景文本编辑需替换店面招牌等场景表面上的文字。
- 论文公开站arXiv
STEPQuant:Delta规则循环状态量化中误差何时何地重要
STEPQuant: When and Where Errors Matter in Delta-Rule Recurrent State Quantization
线性注意力用固定大小循环状态替代增长的KV缓存,但这些持久状态在并发服务下可能成为内存瓶颈。直接低精度量化循环状态常导致严重精度下降。本文提出STEPQuant。
- 论文公开站arXiv
TokenCast:预测LLM智能体执行中的Token消耗
TokenCast: Forecasting Token Consumption During LLM Agent Execution
同一任务下LLM智能体各次运行的Token消耗可相差一个数量级以上,因智能体依据工具反馈与中间结果选择下一步,且上下文不断膨胀推高输入规模。
- 论文公开站arXiv
PDMD:面向视频扩散模型的投影分布匹配蒸馏
PDMD: Projected Distribution Matching Distillation for Video Diffusion Models
现代视频扩散模型需在长时空Token序列上进行数十次去噪评估,分布匹配蒸馏(DMD)可将函数评估次数降至几次,但DMD样本在训练中会退化。
- 论文公开站arXiv
FurE:无需动物毛发数据集的高效实例级3D毛发重建
FurE: Efficient Instance-Specific 3D Fur Reconstruction without Animal-Fur Datasets
从多视角图像重建逼真可编辑的动物毛发面临精细细节、自遮挡与混淆等挑战,且不同于人类头发,缺乏动物毛发数据集。
- 论文公开站arXiv
OC-GS:面向不规则转台拍摄的高斯泼溅重建
OC-GS: Gaussian Splatting for Irregular Turntable Capture
摘要显示,针对转台拍摄中旋转不均与丢帧导致等角度假设失效的问题,OC-GS 提出以物体为中心的高斯泼溅方法,在共享相机、旋转轴与枢轴的前提下细化每张图像的拍摄角度,联合优化图像几何与角度。在 12、8、6 个不规则视角下,前景 PSNR 分别为 21.26、19.36、15.83dB,均优于四个无位姿高斯泼溅基线;共享训练器下细化角度比固定估计提升 7.88dB,真实拍摄提升 0.70dB。
意义:为稀疏、不规则转台拍摄提供无需精确位姿的三维重建思路,对低成本物体扫描与高斯泼溅应用有参考价值。
- 论文公开站arXiv
交换多重态框架中的交错磁性与广义张量性质
Altermagnetism and generalised tensorial properties in the exchange multiplet framework
摘要显示,该工作基于 Bertaut–Izyumov 交换多重态形式,提出一个用于计算磁性材料时间反演奇张量性质的表示论框架。与依赖不同磁点群或自旋群的方法不同,该框架将序参量视为连续变量。对于恒定磁矩共线结构,协变性对 Landau–Lifshitz 展开中的张量交织子施加简单对称约束,得到可分解磁性与晶体学部分的规范形式,并自动恢复磁点群选择定则,同时分离共旋与非共旋贡献。
意义:为交错磁体与反铁磁体的张量性质计算提供连续序参量框架,便于第一性原理与实验对接。
- 论文公开站arXiv
DolphinBench:绘制智能体记忆的帕累托前沿
DolphinBench: Mapping the Pareto Frontier of Agent Memory
摘要显示,现有记忆基准多采用对话问答形式,问题本身已暗示需检索的事实,且仅以准确率评分,允许系统以不合理成本与时间换取高分。DolphinBench 改为通过智能体任务完成度直接评估记忆,包含三种知识工作角色,每角色约 50 万 token 用户消息,每个角色 200 项任务均经有/无相关历史对照验证,并要求同时报告总成本与延迟。
意义:为智能体记忆系统提供兼顾准确率、成本与延迟的评测基准,有助于避免以不合理开销刷分的记忆方案。
- 论文公开站arXiv
onPanda:通过词元级修正高效标注LLM与智能体对齐数据
onPanda: Efficient Annotation of On-Policy Alignment Data for LLMs and Agents via Token-Level Correction
摘要显示,onPanda是一款用于高效标注LLM对齐数据与Agent轨迹的交互式工具,核心交互为Token级校正:标注者定位首个不当Token,从候选Token中选择替代或自由编辑,系统截断其后内容并从修正前缀继续生成,循环此过程。摘要称小规模对照研究显示其中位标注时间较人工后编辑减少52%,且因绝大多数Token由模型生成,数据较好保留采样分布,适合构建on-policy SFT与偏好数据;同时发布Panda-CVL数据集及Token…
意义:Token级校正以低成本产出贴近模型采样分布的on-policy数据,并天然形成带位置的正负样本,可提升SFT与偏好数据构建效率。
- 论文公开站arXiv
GameHorizon套件:游戏中的多时间跨度数据与评估
GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay
摘要显示,现有游戏数据集与基准存在覆盖游戏少、缺少语言指令、依赖高方差在线回合等问题。为此作者提出 GameHorizon 统一数据与评测套件,包含可扩展的多时间尺度指令标注流水线 GameHorizon-Annotator、首个大规模 AAA 游戏数据集 GameHorizon-Data(21 款游戏、5000 小时、100 名人类专家玩家录制,含时间对齐视频、玩家操作与多时间尺度指令),以及支持可复现离线与分步在线测试的 GameH…
意义:为游戏智能体提供可复现的多时间尺度评测与大规模对齐数据,有助于定位长程规划与动作控制的失败环节。
- 论文公开站arXiv
SeeQ:为长时程机器人操作训练通用价值函数
SeeQ: Training Generalist Value Functions for Long-Horizon Robotic Manipulation
摘要显示,通用机器人策略在包含多阶段或需反复尝试的长时程任务上表现脆弱。SeeQ 提出学习当前活跃子任务的 Q 值,以缩短价值预测时程,从而可用时序差分目标有效训练;训练时利用离线机器人数据中的子任务标注,测试时由视觉-语言骨干自回归预测自然语言子任务再估值。在两种双臂机器人平台的四个真实操作任务上,该方法显著提升了 best-of-N 策略引导效果。
意义:为长时程机器人操作提供可扩展的价值函数训练范式,降低稀疏奖励下的信用分配难度,对通用机器人策略与强化学习结合有参考价值。
- 论文公开站arXiv
LLM助手的可验证社会推理
Verifiable Social Reasoning for LLM Assistants
摘要显示,针对LLM助手在社交咨询场景中难以评测的问题,研究者提出Fuse多智能体仿真框架:目标智能体带有隐藏动机,与包括用户代表的智能体互动,用户再向被评测助手咨询以推断该动机,从而天然构造可验证的真实标签。研究用2.4万条标注的人类研究验证仿真保真度,并在12个LLM上实验,发现用户中介会加剧社会推理难度、模型对用户有偏框架存在系统性敏感、模型有时需要比人类更多的细节才能做出正确预测,且更长对话不总能提升表现。作者开源Fuse及含2…
意义:为LLM社交推理提供可验证评测基准与开源数据集,揭示用户中介与偏见框架对模型判断的系统性影响,利于助手安全性评估。
- 论文公开站arXiv
递归经验-工作记忆演化:面向长周期智能体框架的自我改进架构
Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses
摘要介绍Recuris架构,通过工作记忆追踪任务进度并引导技能选择,将执行转化为结构化证据,定位失败至记忆组件。固定元代理将证据转化为局部验证的更新,形成有界递归记忆演化循环。在四个长周期基准和十个模型上,35/37对任务成功提升,如tau-bench上GPT-5.6 Sol提升17.8点,Claude Opus 5提升15.6点至87.9%。
意义:为长周期智能体提供可扩展的递归自我改进机制,显著提升任务成功率,对AI代理的长期自主性发展具有重要意义。
- 论文公开站arXiv
均匀与重掩码离散扩散模型的自适应采样保证
Provably adaptive sampling with uniform and remasking discrete diffusion models
摘要显示,针对均匀前向过程的离散扩散模型,标准τ-leaping采样器的下界随维度d线性增长,但该研究提出一种基于留一法去噪器的一阶采样器,支持并行坐标更新,并能纠正采样中的去噪错误。主要结果建立了自适应采样保证:在忽略对数因子下,N = O(DTC(X0)/ε)步即可达到O(ε_score+ε)的采样误差,其中DTC为双总相关,表明采样复杂度由目标分布的内在结构而非维度决定。
意义:该研究为离散扩散模型提供了更高效的采样方法,将采样复杂度与数据内在结构关联,有望提升高维生成任务的效率,对生成式AI的推理优化有重要意义。
- 论文公开站arXiv
Re³Cap:基于检索引导的强化学习图像描述优化方法
Re$^3$Cap: Retrieval-Guided Refinement for Image Captioning Enhancement via Reinforcement Learning
Re³Cap提出一种检索引导的推理策略,用于增强图像描述生成,无需额外标注。该方法通过描述细化建议器和质量评估器,识别并修正描述中的幻觉与遗漏,从而生成更准确、详细的描述。实验表明,在COCO-LN500基准上,Re³Cap在关系推理任务上平均比GRPO提升8.64%,甚至优于监督微调方法。
意义:该方法利用多模态检索作为推理信号,提升强化学习在图像描述中的探索能力,为无需额外标注的模型优化提供了新思路。