- 论文公开站arXiv
图像分类器是高效的自监督视频表征学习器
Image Classifiers are Efficient Self-Supervised Video Representation Learners
提出 VideoMSN,一种用于视频高效自监督时空表征学习的掩码孪生网络框架。它不依赖重型3D架构或重建式自编码器,而是复用标准图像分类器处理无标注数据。
- 论文公开站arXiv
ViTeX-Bench:高保真视频场景文本编辑基准
ViTeX-Bench: Benchmarking High-Fidelity Video Scene Text Editing
视频生成日益逼真可控,但视频编辑仍欠成熟,尤其是需保持原始场景动态的精确局部编辑。视频场景文本编辑需替换店面招牌等场景表面上的文字。
- 论文公开站arXiv
打破同质化陷阱:通过SplitMoE扩展视频扩散模型
Breaking the Uniformity Trap: Scaling Video Diffusion Model via SplitMoE
受大语言模型启发的混合专家(MoE)是扩展视觉生成模型的有前景范式,但传统token级MoE在同类专家池中独立路由token并趋向均匀化,限制了性能。本文提出SplitMoE方法。
- 论文公开站arXiv
反事实视频生成实现可扩展人形机器人移动操作
Counterfactual Video Generation Enables Scalable Humanoid Loco-Manipulation
通过视觉模仿教授人形机器人移动操作技能(如搬运多样物体)是通向通用机器人的有前景路径。但收集多样高质量交互视频(清晰展示人体全身和无遮挡交互)仍具挑战。
- 论文公开站arXiv
MINT:建模生成式AI对网络流量的影响
MINT: Modeling GenAI Impact on Network Traffic
生成式AI正成为主流网络负载,但数据包级模拟器缺乏基于实测的GenAI流量模型。目前研究人员只能用文件传输和视频流等传统来源近似GenAI服务,限制了真实性。
- 论文公开站arXiv
PDMD:面向视频扩散模型的投影分布匹配蒸馏
PDMD: Projected Distribution Matching Distillation for Video Diffusion Models
现代视频扩散模型需在长时空Token序列上进行数十次去噪评估,分布匹配蒸馏(DMD)可将函数评估次数降至几次,但DMD样本在训练中会退化。
- 资讯公开站Entrepreneur
我用AI搭建了一个7人营销团队,以下是具体配置
I Built a 7-Person Marketing Team Using AI. Here’s the Exact Setup.
摘要显示,一位作者介绍了如何借助AI组建相当于7人规模的营销团队,为研究、写作、设计、视频、排期和分析等环节分别构建专门的AI智能体,且无需从零开始搭建。文章以自身实践为例,给出可直接套用的配置思路。
意义:对希望以低成本扩充营销产能的开发者与创业者,提供了多智能体分工落地的参考路径。
- 资讯公开站IEEE Spectrum Robotics
视频星期五:有只小机器鹅,生活更美好
Video Friday: Life’s Better With a Little Robot Goose
摘要显示,IEEE Spectrum Robotics 的每周视频精选栏目「Video Friday」本期以「小机器鹅让生活更美好」为主题,收录了多段机器人视频,并列出未来数月机器人领域会议日程:IROS 2026(2026年9月27日至10月1日,匹兹堡)、CoRL 2026(2026年11月9日至12日,奥斯汀)、Humanoids 2026(2026年12月6日至9日,圣克拉拉)。其中提到 Skydio 推出 F10 固定翼无人机…
意义:为开发者提供机器人领域最新视频案例与会议时间线,并展示 Skydio 固定翼无人机自主起降的机械臂方案。
- 资讯公开站CNX Software
紧凑型长波红外相机:STM32N6 MCU搭配Lynred ATI320热传感器
Compact Long-Wave Infrared camera pairs STM32N6 MCU with Lynred ATI320 thermal sensor
摘要显示,8devices 推出 8Sight T100 紧凑型长波红外热成像相机,面向无人机、机器人与工业应用。其将 Lynred ATI320 长波红外传感器与 STM32N6(Arm Cortex-M55,含 Neural-ART NPU 与硬件 ISP)结合,可提供 320×240、60fps 热成像视频,并完全离线运行,支持部署自定义 AI 模型进行目标检测、异常检测或温度触发事件。
意义:该产品把热成像传感器与带 NPU 的 MCU 集成在紧凑模块中,使边缘设备无需云端即可完成实时热成像 AI 推理,利好无人机与工业检测开发者。
- 论文公开站arXiv
TrackEverything:通过去重3D场景表示实现长时程稠密跟踪
TrackEverything: Long Horizon Dense Tracking via De-Duplicating 3D Scene Representations
摘要显示,现有3D点追踪模型面临稀疏长时程与稠密短片段之间的权衡。TrackEverything将视频表示为世界坐标系下的持久3D场景轨迹,通过滑动窗口边界体素化去重、端点细化器加轻量轨迹细化器的两阶段分解,以及用场景点云特征采样替代4D相关体积的3D WAFT,把模型复杂度与视频时长解耦。摘要称其为首个能在40GB显存内追踪超1000帧视频全部可见点的3D追踪器,在TAPVid-3D短片段上较开源全帧稠密3D追踪器APD提升超20%。
意义:为长视频稠密3D点追踪提供了显存可控的新范式,有望推动机器人、视频编辑与4D重建等长时程应用。
- 论文公开站arXiv
Rolling-WAM:带滚动想象的世界动作模型
Rolling-WAM: World Action Models with Rolling Imagination
摘要显示,世界动作模型(WAM)将动作生成与未来视觉预测耦合,但每个重规划周期都要完成完整的视频-动作联合去噪,带来显著延迟。Rolling-WAM 将联合去噪分散到连续的重规划周期中,用滑动窗口维护处于不同噪声水平的视频-动作块:每步完整去噪即将执行的动作块,同时部分精炼更远未来的块,并随新相机观测推进窗口。在 LIBERO、RoboTwin 与真实 Unitree G1 人形机器人上,摘要称其达到有竞争力的操作性能,并相较标准联合 …
意义:为机器人操作中的视频-动作联合模型提供低延迟重规划思路,把计算摊到时间轴上,提升闭环响应速度。
- 资讯公开站Entrepreneur
以为最聪明的客户能识别虚假内容?数据显示恰恰相反
Think Your Smartest Customers Can Spot Fake Content? Our Data Says the Opposite. Here’s What It Means for Your Business.
Entrepreneur 报道一项 315 人研究,测试人们能否区分 AI 编辑视频与人工编辑视频。摘要显示,研究团队原本预期最难被欺骗的群体,结果反而最容易被骗。文章据此讨论这一发现对企业营销与内容信任策略的含义。
意义:提示开发者与企业:用户对AI生成内容的辨别力可能低于预期,内容真实性与标识机制需重新评估。
- 资讯公开站Nature News
YouTube体育视频的年轻粉丝们粘在沙发上
Youthful fans of YouTube sports videos stick to the sofa
《自然》新闻报道的一项研究显示,热衷在 YouTube 上观看体育视频的年轻观众反而更少参与实际运动,更多时间待在沙发上。摘要显示该研究关注数字体育内容消费与青少年身体活动水平之间的关联,提示线上观赛可能替代而非促进线下锻炼。
意义:提醒产品与推荐算法设计者关注内容消费对行为的替代效应,体育类内容未必带来健康收益。
- 资讯公开站MIT Technology Review
美国众议员提议终止边境监控塔项目
A congressional representative just proposed killing America’s border tower program
摘要显示,美国伊利诺伊州民主党众议员 Delia Ramirez 宣布计划提出新立法,终止美国南部边境的监控塔项目。该声明发布于 MIT Technology Review 调查报道《Dying on Camera》刊出数日之后,该报道关注了边境地区发生的死亡事件。
意义:边境监控塔涉及大规模视频监控与AI分析,立法动向可能影响相关技术采购与部署,值得关注监控技术政策风险的开发者留意。
- 资讯公开站MIT Technology Review
智能眼镜已在印度引发混乱
Smart glasses are already causing havoc in India
摘要显示,印度出现由智能眼镜引发的隐私与社会混乱:一名为 Shubnam 的人士在搬家时收到朋友发来的 Instagram 视频,该视频拍摄于今年春天德里一场反对限制跨性别者法律承认的抗议活动,录制已有数日,但上传仅数小时。报道以此说明智能眼镜可被用于未经同意拍摄并快速传播现场影像。
意义:可穿戴摄像设备使未经同意的拍摄与传播更隐蔽,开发者需重视隐私设计、数据合规与滥用风险。
- 论文公开站arXiv
DreamStream:面向端到端驾驶的策略导向生成式仿真
DreamStream: Towards Policy-Oriented Generative Simulation for End-to-End Driving
摘要显示,现有仿真平台存在仿真到真实的视觉差距,会破坏策略感知,难以评估端到端驾驶策略的闭环决策。作者提出 DreamStream,一种基于仿真器接地的自回归视频模型构建的生成式闭环仿真器,通过交通布局引导从大型预训练视频模型蒸馏,在改变视觉外观的同时保留场景布局与动态物体时序一致性等策略相关特征。作者还指出 FID 等感知指标会误判特征保留程度,并提出多表示指标 FDπ。摘要称,在 FDπ 下 DreamStream 相比最强先前闭环…
意义:为端到端自动驾驶提供更贴近策略感知的闭环仿真与评测指标,有望降低真实路测成本并暴露策略失效场景。
- 资讯公开站Ars Technica
Adobe Premiere终于将强大视频编辑带到Android,且免费
Adobe Premiere finally brings powerful video editing to Android, and it's free
摘要显示,Adobe Premiere 终于将较强的视频剪辑能力带到 Android 平台,且无需 Creative Cloud 登录即可编辑片段;不过 AI 相关功能需要额外付费。原文未披露具体功能清单、支持机型与上线时间等细节。
意义:移动端剪辑门槛进一步降低,免费+免登录策略或挤压 CapCut 等竞品,同时暗示 AI 视频功能成为付费变现重点。
- 论文公开站arXiv
DexTacWAM:面向灵巧操作的视触觉世界-动作模型
DexTacWAM: A Visuo-Tactile World-Action Model for Dexterous Manipulation
摘要显示,DexTacWAM 是一种视触觉世界-动作模型(WAM),将各指尖触觉独立编码,经手指与姿态感知的触觉压缩器聚合后注入视频扩散世界模型,实现视触觉联合世界建模。在 22 自由度双臂平台的六项富接触灵巧操作任务中均取得最高分,平均 70.6,最强基线为 38.0。消融表明收益来自将接触演化纳入预测世界状态,而非仅做触觉条件化。
意义:把触觉纳入世界模型而非仅作条件输入,为富接触机器人操作提供了新范式,对具身智能与多模态世界模型研究有直接参考价值。
- 论文公开站arXiv
WorldCrafter:具有隐式3D感知记忆的一致视频世界模型
WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory
摘要显示,WorldCrafter 是一种视频世界模型,学习可被相机查询的隐式3D感知记忆,让请求视角决定多视角证据如何压缩进视频生成器有限的 token 预算。记忆编码器与姿态条件读出模块同视频生成器联合训练,在去噪前将历史观测整合为固定数量的目标视角专属 token,无需显式深度对应。结合近期时序上下文与少步蒸馏,该模型支持从单张图像或文本提示进行流式场景探索,在静态与动态场景中提升了长时程一致性与相机控制精度。
意义:为长时程、跨视角一致的交互式视频世界模型提供隐式3D记忆方案,利于场景探索与相机控制类应用。
- 论文公开站arXiv
GameHorizon套件:游戏中的多时间跨度数据与评估
GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay
摘要显示,现有游戏数据集与基准存在覆盖游戏少、缺少语言指令、依赖高方差在线回合等问题。为此作者提出 GameHorizon 统一数据与评测套件,包含可扩展的多时间尺度指令标注流水线 GameHorizon-Annotator、首个大规模 AAA 游戏数据集 GameHorizon-Data(21 款游戏、5000 小时、100 名人类专家玩家录制,含时间对齐视频、玩家操作与多时间尺度指令),以及支持可复现离线与分步在线测试的 GameH…
意义:为游戏智能体提供可复现的多时间尺度评测与大规模对齐数据,有助于定位长程规划与动作控制的失败环节。
- 资讯公开站Entrepreneur
TikToker靠伪装成日常内容的广告月入最高6000美元,合法吗
TikTokers Make Up to $6,000 a Month Posting Sneaky Ads That Don’t Look Like Ads — But Is It Legal?
摘要显示,部分TikTok创作者通过发布看似日常内容的视频(如分手、吐槽、日常生活)植入付费推广,每月最高可赚取6000美元。这些广告伪装成普通内容,大多数观众并未意识到自己正在观看付费推广。报道对这类行为的合法性提出疑问。
意义:对内容平台和广告从业者而言,原生广告的边界日益模糊,合规风险与平台监管压力上升。
- 开源项目公开站GitHub
harry0703/MoneyPrinterTurbo:AI 一键生成高清短视频
harry0703/MoneyPrinterTurbo — 利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short videos from a topic or keyword with an automated AI workflow.
摘要显示,MoneyPrinterTurbo 是一个利用 AI 大模型和自动化工作流、根据主题或关键词一键生成高清短视频的开源项目。其 GitHub 页面标注星标数约 124,850,说明该项目在开发者社区中具有较高关注度。摘要未披露所调用模型、生成流程细节或输出规格等信息。
意义:为开发者提供短视频自动生成的开源参考实现,可复用于内容生产与AI工作流集成。
- 资讯公开站Electrek
设备聚焦:4400马力Wabtec FLXDrive电力机车[更新]
E-quipment highlight: 4,400 hp Wabtec FLXDrive electric locomotive [update]
摘要显示,Wabtec FLXDrive 是一款 4,400 马力的电池电力重载机车,已在澳大利亚 Jimblebar 铁矿专用线路上运行近一年。必和必拓(BHP)据此认为该型机车已具备正式投用条件。原文于 2026 年 9 月 19 日更新,补充了一段相关视频,但未披露具体运营数据或性能指标。
意义:重载运输电气化是电池与电力电子技术的重要落地场景,其长期运行验证对工业脱碳与储能系统集成有参考价值。
- 资讯公开站Electrek
终于来了:保时捷将无线EV充电投入生产[视频]
It’s finally here: Porsche puts wireless EV charging into production [video]
摘要显示,保时捷在一份关于Cayenne Electric新配色与便利性升级的新闻稿中低调宣布,将首次为该款高性能纯电SUV提供无线感应充电功能,并已进入量产阶段。原文标题称这一功能「终于到来」,但摘要未披露充电功率、效率、选装价格及上市时间等具体参数。
意义:无线充电量产落地意味着电动车补能体验进一步无感化,或推动车企与充电设备商跟进感应式充电方案。
- 论文公开站arXiv
ERCPMP-Gx:用于结直肠息肉形态、组织病理与基因组表征的内镜图像视频数据集
ERCPMP-Gx: Endoscopic Image and Video Dataset for Morphological, Histopathological, and Genomic Characterization of Colorectal Polyposis
摘要显示,该数据集面向遗传性息肉病综合征的AI识别与分类,包含160张图像及配套视频片段,多数采用Olympus EVIS X1的白光、窄带成像、放大窄带成像与近聚焦模式采集。约八成病例为经临床或基因确诊的遗传性息肉病综合征(FAP、PJS、JPS、GNS),其余两成为形态重叠的非遗传性息肉及类息肉病变,用于鉴别分类,并关联组织病理与胚系检测信息。
意义:为AI在内镜图像中区分遗传性与非遗传性息肉病提供多模态标注数据,有望推动结直肠癌早期筛查与个体化监测模型研发。