全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「视频」共 19 条

  • 论文公开站arXiv

    图像分类器是高效的自监督视频表征学习器

    Image Classifiers are Efficient Self-Supervised Video Representation Learners

    提出 VideoMSN,一种用于视频高效自监督时空表征学习的掩码孪生网络框架。它不依赖重型3D架构或重建式自编码器,而是复用标准图像分类器处理无标注数据。

  • 论文公开站arXiv

    ViTeX-Bench:高保真视频场景文本编辑基准

    ViTeX-Bench: Benchmarking High-Fidelity Video Scene Text Editing

    视频生成日益逼真可控,但视频编辑仍欠成熟,尤其是需保持原始场景动态的精确局部编辑。视频场景文本编辑需替换店面招牌等场景表面上的文字。

  • 论文公开站arXiv

    打破同质化陷阱:通过SplitMoE扩展视频扩散模型

    Breaking the Uniformity Trap: Scaling Video Diffusion Model via SplitMoE

    受大语言模型启发的混合专家(MoE)是扩展视觉生成模型的有前景范式,但传统token级MoE在同类专家池中独立路由token并趋向均匀化,限制了性能。本文提出SplitMoE方法。

  • 论文公开站arXiv

    反事实视频生成实现可扩展人形机器人移动操作

    Counterfactual Video Generation Enables Scalable Humanoid Loco-Manipulation

    通过视觉模仿教授人形机器人移动操作技能(如搬运多样物体)是通向通用机器人的有前景路径。但收集多样高质量交互视频(清晰展示人体全身和无遮挡交互)仍具挑战。

  • 广告适用Apple Watch S12系列硅胶表带S11手表表带官方 S9防…新款·淘宝·Apple相关相关商品上架/在售信号淘宝¥59.8 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    MINT:建模生成式AI对网络流量的影响

    MINT: Modeling GenAI Impact on Network Traffic

    生成式AI正成为主流网络负载,但数据包级模拟器缺乏基于实测的GenAI流量模型。目前研究人员只能用文件传输和视频流等传统来源近似GenAI服务,限制了真实性。

  • 论文公开站arXiv

    PDMD:面向视频扩散模型的投影分布匹配蒸馏

    PDMD: Projected Distribution Matching Distillation for Video Diffusion Models

    现代视频扩散模型需在长时空Token序列上进行数十次去噪评估,分布匹配蒸馏(DMD)可将函数评估次数降至几次,但DMD样本在训练中会退化。

  • 论文公开站arXiv

    TrackEverything:通过去重3D场景表示实现长时程稠密跟踪

    TrackEverything: Long Horizon Dense Tracking via De-Duplicating 3D Scene Representations

    摘要显示,现有3D点追踪模型面临稀疏长时程与稠密短片段之间的权衡。TrackEverything将视频表示为世界坐标系下的持久3D场景轨迹,通过滑动窗口边界体素化去重、端点细化器加轻量轨迹细化器的两阶段分解,以及用场景点云特征采样替代4D相关体积的3D WAFT,把模型复杂度与视频时长解耦。摘要称其为首个能在40GB显存内追踪超1000帧视频全部可见点的3D追踪器,在TAPVid-3D短片段上较开源全帧稠密3D追踪器APD提升超20%。

    意义:为长视频稠密3D点追踪提供了显存可控的新范式,有望推动机器人、视频编辑与4D重建等长时程应用。

  • 论文公开站arXiv

    Rolling-WAM:带滚动想象的世界动作模型

    Rolling-WAM: World Action Models with Rolling Imagination

    摘要显示,世界动作模型(WAM)将动作生成与未来视觉预测耦合,但每个重规划周期都要完成完整的视频-动作联合去噪,带来显著延迟。Rolling-WAM 将联合去噪分散到连续的重规划周期中,用滑动窗口维护处于不同噪声水平的视频-动作块:每步完整去噪即将执行的动作块,同时部分精炼更远未来的块,并随新相机观测推进窗口。在 LIBERO、RoboTwin 与真实 Unitree G1 人形机器人上,摘要称其达到有竞争力的操作性能,并相较标准联合 …

    意义:为机器人操作中的视频-动作联合模型提供低延迟重规划思路,把计算摊到时间轴上,提升闭环响应速度。

  • 广告AnkerPrime安克25W三折叠风冷无线充磁吸充电器快充适用苹果18…新款·淘宝·苹果相关手机上架/在售信号淘宝¥1199 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    DreamStream:面向端到端驾驶的策略导向生成式仿真

    DreamStream: Towards Policy-Oriented Generative Simulation for End-to-End Driving

    摘要显示,现有仿真平台存在仿真到真实的视觉差距,会破坏策略感知,难以评估端到端驾驶策略的闭环决策。作者提出 DreamStream,一种基于仿真器接地的自回归视频模型构建的生成式闭环仿真器,通过交通布局引导从大型预训练视频模型蒸馏,在改变视觉外观的同时保留场景布局与动态物体时序一致性等策略相关特征。作者还指出 FID 等感知指标会误判特征保留程度,并提出多表示指标 FDπ。摘要称,在 FDπ 下 DreamStream 相比最强先前闭环…

    意义:为端到端自动驾驶提供更贴近策略感知的闭环仿真与评测指标,有望降低真实路测成本并暴露策略失效场景。

  • 论文公开站arXiv

    DexTacWAM:面向灵巧操作的视触觉世界-动作模型

    DexTacWAM: A Visuo-Tactile World-Action Model for Dexterous Manipulation

    摘要显示,DexTacWAM 是一种视触觉世界-动作模型(WAM),将各指尖触觉独立编码,经手指与姿态感知的触觉压缩器聚合后注入视频扩散世界模型,实现视触觉联合世界建模。在 22 自由度双臂平台的六项富接触灵巧操作任务中均取得最高分,平均 70.6,最强基线为 38.0。消融表明收益来自将接触演化纳入预测世界状态,而非仅做触觉条件化。

    意义:把触觉纳入世界模型而非仅作条件输入,为富接触机器人操作提供了新范式,对具身智能与多模态世界模型研究有直接参考价值。

  • 论文公开站arXiv

    WorldCrafter:具有隐式3D感知记忆的一致视频世界模型

    WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory

    摘要显示,WorldCrafter 是一种视频世界模型,学习可被相机查询的隐式3D感知记忆,让请求视角决定多视角证据如何压缩进视频生成器有限的 token 预算。记忆编码器与姿态条件读出模块同视频生成器联合训练,在去噪前将历史观测整合为固定数量的目标视角专属 token,无需显式深度对应。结合近期时序上下文与少步蒸馏,该模型支持从单张图像或文本提示进行流式场景探索,在静态与动态场景中提升了长时程一致性与相机控制精度。

    意义:为长时程、跨视角一致的交互式视频世界模型提供隐式3D记忆方案,利于场景探索与相机控制类应用。

  • 论文公开站arXiv

    GameHorizon套件:游戏中的多时间跨度数据与评估

    GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay

    摘要显示,现有游戏数据集与基准存在覆盖游戏少、缺少语言指令、依赖高方差在线回合等问题。为此作者提出 GameHorizon 统一数据与评测套件,包含可扩展的多时间尺度指令标注流水线 GameHorizon-Annotator、首个大规模 AAA 游戏数据集 GameHorizon-Data(21 款游戏、5000 小时、100 名人类专家玩家录制,含时间对齐视频、玩家操作与多时间尺度指令),以及支持可复现离线与分步在线测试的 GameH…

    意义:为游戏智能体提供可复现的多时间尺度评测与大规模对齐数据,有助于定位长程规划与动作控制的失败环节。

  • 广告适用Apple苹果Watch Ultra 4手表钢化膜苹果Ultra4保…新款·淘宝·苹果相关相关商品上架/在售信号淘宝¥13.8 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    ERCPMP-Gx:用于结直肠息肉形态、组织病理与基因组表征的内镜图像视频数据集

    ERCPMP-Gx: Endoscopic Image and Video Dataset for Morphological, Histopathological, and Genomic Characterization of Colorectal Polyposis

    摘要显示,该数据集面向遗传性息肉病综合征的AI识别与分类,包含160张图像及配套视频片段,多数采用Olympus EVIS X1的白光、窄带成像、放大窄带成像与近聚焦模式采集。约八成病例为经临床或基因确诊的遗传性息肉病综合征(FAP、PJS、JPS、GNS),其余两成为形态重叠的非遗传性息肉及类息肉病变,用于鉴别分类,并关联组织病理与胚系检测信息。

    意义:为AI在内镜图像中区分遗传性与非遗传性息肉病提供多模态标注数据,有望推动结直肠癌早期筛查与个体化监测模型研发。

  • 论文公开站arXiv

    梦见接触之声:利用视频和音频生成实现零样本力感知操作与数据生成

    Dreaming the Sound of Contact: Leveraging Video and Audio Generation for Zero-Shot Force-Aware Manipulation and Data Generation

    摘要显示,该工作针对生成视频仅含运动学轨迹、缺乏力信息的问题,提出用生成接触声音的响度构造有界且随时间变化的期望力曲线,并结合生成视频从结构化自然语言任务提示中同时推导运动轨迹与期望力。作者在 Franka Panda 机器人上用闭环力调节器跟踪该音频塑形的力曲线,在多个需接触的任务上成功完成操作,而仅运动学基线失败;该流程还被用作数据生成引擎训练闭环策略。

    意义:为机器人操作引入音频作为力感知信号,弥补生成视频缺少接触力信息的短板,并提供可复用的数据生成思路。

  • 论文公开站arXiv

    基于VLM智能体的上下文机器人学习

    In-Context Robot Learning with VLM Agents

    摘要显示,该研究提出 GPT-Policy,一种面向上下文机器人学习的通用智能体框架,整合了保留任务相关视觉过渡的上下文编译器、提出机器人工具动作的视觉语言模型(VLM),以及验证并执行动作、反馈结果的受限控制器。在真实机器人试验中,人类视频演示即使没有机器人动作标签也能提升任务完成率,对齐的动作参考在接触敏感任务上带来进一步增益,无需梯度更新或持久修改任务参数。

    意义:为机器人泛化提供无需微调的新范式,降低部署成本,并凸显VLM作为机器人策略核心组件的潜力。

  • 论文公开站arXiv

    PointZero:用于学习可迁移3D动力学的3D点轨迹补全

    PointZero: 3D Point Track Completion for Learning Transferable 3D Dynamics

    摘要显示,该研究提出将三维点轨迹补全作为预训练目标,在无需机器人动作标签的情况下学习可迁移的三维动力学先验。给定单次RGB-D观测与稀疏部分三维轨迹,模型预测所有观测点的未来三维轨迹。作者构建了涵盖可变形、铰接与刚性物体的290万帧合成数据集,并训练了基于Transformer的PointZero,在相同数据上优于既有方法;微调后在PGND三维动力学基准及6/7项仿真与真实机器人操作任务上表现优异。

    意义:为机器人学习提供无需动作标签的3D动力学预训练范式,可纳入网络视频数据,降低对昂贵机器人数据的依赖。

  • 广告适用于Apple苹果Watch Ultra 4手表钢化膜Ultra4保护…新款·淘宝·苹果相关相关商品上架/在售信号淘宝¥13.8 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    PhysStream:具结构化场景记忆与细粒度运动控制的流式物理视频生成

    PhysStream: Streaming Physics-Grounded Video Generation with Structured Scene Memory and Fine-Grained Motion Control

    摘要显示,PhysStream 是一种自回归图像到视频生成模型,面向物理落地的动态场景合成。它引入结构化场景记忆(位置图与目标跟踪图,由已生成帧在线推导),并用稀疏速度增量信号编码物理量实现细粒度运动控制。模型分两阶段训练:先对双向模型做运动控制条件微调,再训练带场景记忆的因果自回归模型。摘要称其在桌面刚体多物体场景中支持生成中途交互控制,合成基准上 FVMD 降低 33%、轨迹误差降低 12%,人类评估中超过 85% 的对比更受偏好。

    意义:为视频生成引入可在线更新的场景记忆与物理量级控制信号,使生成过程可中途干预,对交互式世界模型与可控视频生成方向有参考价值。

  • 论文公开站arXiv

    LAION-BVD:千万小时级开放视频数据集,助力多模态预训练

    LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training

    LAION-BVD是LAION发布的大规模开放视频数据集,包含从CommonCrawl收集的13亿条平台视频URL,成功下载8000万段视频,总时长1000万小时。该数据集旨在支持视频、音频和图像多模态预训练,通过场景检测提取片段并合成字幕。基于此训练的模型在视频-文本和音频-文本基准上表现优异,且性能随规模提升。此外,提取的场景帧作为图像-文本数据源,展现出与网络图像不同的分布,模型在图像-文本检索上表现强劲。数据集已开源,显著扩大了…

    意义:为多模态预训练提供千万小时级开放视频资源,填补大规模视频数据空白,推动视频、音频、图像联合学习研究。

  • 论文公开站arXiv

    ReWorld:具备长时记忆的交互式世界模型

    ReWorld: An Interactive World Model with Long-Horizon Memory

    摘要显示,ReWorld是一种交互式世界模型,通过混合注意力窗口和随机头路由,在训练时分离控制与记忆,推理时使用有界KV缓存和姿态索引地标库,实现长时记忆下的实时视频生成。数据引擎统一多源数据尺度,并通过LoRA蒸馏实现四步采样,在704x1280分辨率下实时生成,在动作跟随、长时记忆和视频质量方面优于六种现有模型。

    意义:ReWorld解决了交互式世界模型中控制与记忆的结构性矛盾,实现了长时记忆下的实时高保真视频生成,对虚拟现实、游戏和机器人仿真等应用具有重要意义。