全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「视频」共 46 条

  • 资讯公开站Ars Technica

    认识尼康小世界动态视频大赛获胜者

    Meet the winner of Nikon's Small World in Motion video contest

    摘要显示,清华大学徐宁拍摄了一名罕见呼吸系统疾病患儿气道内微小纤毛的摆动影像,并凭此作品赢得尼康「Small World in Motion」显微视频竞赛冠军。该赛事以动态显微摄影为对象,展示微观尺度下的生命活动。

    意义:高质量动态显微影像为医学与生命科学研究提供直观记录手段,也反映科学可视化在传播中的价值。

  • 资讯公开站IEEE Spectrum Robotics

    视频周五:两个双旋翼组成四旋翼

    Video Friday: Two Birotors Make a Quadrotor

    摘要显示,IEEE Spectrum Robotics 的 Video Friday 栏目本周精选了多段机器人视频,包括 CLIMB Lab 用两个双旋翼组合成四旋翼的演示、ETH Zurich 机器人系统实验室的视频(最后 30 秒被评价为精彩),以及 Figure 人形机器人的展示。文中还列出 Humanoids Summit Seoul、IROS 2026、CoRL 2026 等会议日程,但未提供具体技术细节或数据。

    意义:为开发者提供机器人领域最新演示与会议动态的快速入口,便于跟踪双旋翼/四旋翼、人形机器人等方向的实际进展。

  • 资讯公开站CNX Software

    华硕Ascent QN10迷你PC搭载高通骁龙X2 Elite 18核Armv9处理器

    ASUS Ascent QN10 mini PC is powered by Qualcomm Snapdragon X2 Elite 18-core Armv9 processor

    摘要显示,华硕 Ascent QN10 是首款采用高通骁龙 X2 Elite(Glymur 8480B / X2E-88-100)18 核 Armv9 处理器的迷你主机,面向 Windows Copilot+ PC,AI 算力达 80 TOPS。配置最高 32GB LPDDR5 内存与 512GB 至 2TB NVMe SSD,提供 HDMI 加三个 USB4(40 Gbps)共四路视频输出,并具备 2.5GbE、WiFi 7、音频接口…

    意义:Arm 架构迷你主机首次用上骁龙 X2 Elite,80 TOPS 与多路 USB4 显示输出为端侧 AI 开发和多屏办公提供新选择。

  • 论文公开站arXiv

    梦见接触之声:利用视频和音频生成实现零样本力感知操作与数据生成

    Dreaming the Sound of Contact: Leveraging Video and Audio Generation for Zero-Shot Force-Aware Manipulation and Data Generation

    摘要显示,该工作针对生成视频仅含运动学轨迹、缺乏力信息的问题,提出用生成接触声音的响度构造有界且随时间变化的期望力曲线,并结合生成视频从结构化自然语言任务提示中同时推导运动轨迹与期望力。作者在 Franka Panda 机器人上用闭环力调节器跟踪该音频塑形的力曲线,在多个需接触的任务上成功完成操作,而仅运动学基线失败;该流程还被用作数据生成引擎训练闭环策略。

    意义:为机器人操作引入音频作为力感知信号,弥补生成视频缺少接触力信息的短板,并提供可复用的数据生成思路。

  • 广告适用于Apple苹果Watch Ultra 4手表钢化膜Ultra4保护…新款·淘宝·苹果相关相关商品上架/在售信号淘宝¥15.8 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    基于VLM智能体的上下文机器人学习

    In-Context Robot Learning with VLM Agents

    摘要显示,该研究提出 GPT-Policy,一种面向上下文机器人学习的通用智能体框架,整合了保留任务相关视觉过渡的上下文编译器、提出机器人工具动作的视觉语言模型(VLM),以及验证并执行动作、反馈结果的受限控制器。在真实机器人试验中,人类视频演示即使没有机器人动作标签也能提升任务完成率,对齐的动作参考在接触敏感任务上带来进一步增益,无需梯度更新或持久修改任务参数。

    意义:为机器人泛化提供无需微调的新范式,降低部署成本,并凸显VLM作为机器人策略核心组件的潜力。

  • 论文公开站arXiv

    PointZero:用于学习可迁移3D动力学的3D点轨迹补全

    PointZero: 3D Point Track Completion for Learning Transferable 3D Dynamics

    摘要显示,该研究提出将三维点轨迹补全作为预训练目标,在无需机器人动作标签的情况下学习可迁移的三维动力学先验。给定单次RGB-D观测与稀疏部分三维轨迹,模型预测所有观测点的未来三维轨迹。作者构建了涵盖可变形、铰接与刚性物体的290万帧合成数据集,并训练了基于Transformer的PointZero,在相同数据上优于既有方法;微调后在PGND三维动力学基准及6/7项仿真与真实机器人操作任务上表现优异。

    意义:为机器人学习提供无需动作标签的3D动力学预训练范式,可纳入网络视频数据,降低对昂贵机器人数据的依赖。

  • 论文公开站arXiv

    PhysStream:具结构化场景记忆与细粒度运动控制的流式物理视频生成

    PhysStream: Streaming Physics-Grounded Video Generation with Structured Scene Memory and Fine-Grained Motion Control

    摘要显示,PhysStream 是一种自回归图像到视频生成模型,面向物理落地的动态场景合成。它引入结构化场景记忆(位置图与目标跟踪图,由已生成帧在线推导),并用稀疏速度增量信号编码物理量实现细粒度运动控制。模型分两阶段训练:先对双向模型做运动控制条件微调,再训练带场景记忆的因果自回归模型。摘要称其在桌面刚体多物体场景中支持生成中途交互控制,合成基准上 FVMD 降低 33%、轨迹误差降低 12%,人类评估中超过 85% 的对比更受偏好。

    意义:为视频生成引入可在线更新的场景记忆与物理量级控制信号,使生成过程可中途干预,对交互式世界模型与可控视频生成方向有参考价值。

  • 资讯公开站Ars Technica

    狮门影业发布《收割日出》新预告片

    Lionsgate releases a new trailer for Sunrise on the Reaping

    意义:影视IP预告片是AI生成视频与内容营销工具的重要应用场景,也反映流媒体与院线内容竞争动态。

  • 广告适用于Apple苹果S12手表贴膜WatchS12腕表保护膜42/46m…新款·淘宝·苹果相关相关商品上架/在售信号淘宝¥12.8 · 精选自 全球电商每日爆款去看看
  • 资讯公开站CNX Software

    OpenMANET:基于 802.11ah WiFi HaLow 的高带宽 Meshtastic 替代方案

    OpenMANET – A higher-bandwidth Meshtastic alternative leveraging 802.11ah WiFi HaLow

    OpenMANET 是一个开源项目,利用树莓派单板计算机与 Morse Micro 的 Wi-Fi HaLow(802.11ah)芯片构建远距离无线网状自组网(MANET)。其面向搜救、灾害响应、生存游戏及无网络或基础设施失效场景,可视为 LoRa 系 Meshtastic、Meshcore 的替代方案,带宽更高但硬件更贵、功耗更大,支持一键通话、GPS 位置共享、摄像头/视频流与 ATAK。

    意义:为开发者提供高带宽自组网新选择,802.11ah 与树莓派组合有望降低远距离网状通信开发门槛。

  • 资讯公开站CNX Software

    JetKVM Mini:低成本ESP32-P4X KVM,支持以太网或WiFi

    JetKVM Mini – A low-cost, ESP32-P4X-based KVM with Ethernet or WiFi connectivity

    JetKVM Mini是JetKVM KVM over IP方案的更小、更低成本版本,配备小型信息显示屏,支持以太网或WiFi连接以及1080p视频采集。其核心变化是放弃Rockchip RV1106G3 SoC上的Linux方案,改用ESP32-P4X处理视频采集、H.264编码、USB等功能,最大成本节省来自省去Linux所需的RAM和eMMC闪存。

    意义:展示 ESP32-P4 在 KVM over IP 场景替代 Linux SoC 的可行性,为低成本远程管理设备提供新硬件参考。

  • 资讯公开站CNX Software

    瑞萨RZ/G3L与RZ/G3SE:面向工业HMI和IoT的超低功耗Cortex-A55 MPU

    Renesas RZ/G3L & RZ/G3SE – Ultra-low-power Cortex-A55 MPUs for industrial HMI and IoT applications

    瑞萨扩展RZ/G系列,推出面向HMI与IoT边缘系统的64位MPU:RZ/G3L与RZ/G3SE。两者集成最多四个1.2 GHz Arm Cortex-A55应用核心及200 MHz Cortex-M33实时协处理器,引脚兼容但定位不同。RZ/G3L带Mali-G31 3D GPU与H.264编解码器,面向零售终端、医疗设备等HMI;RZ/G3SE去掉GPU与视频编解码器,面向充电桩和工业网关等基础显示IoT设备。两者待机功耗可降至约1…

    意义:为工业 HMI 与 IoT 边缘设备提供低功耗、可扩展的 Cortex-A55 平台,引脚兼容便于产品线复用,待机功耗与快速唤醒对常连接设备有实际价值。

  • 资讯公开站CNX Software

    Amlogic A123X与C305X2 Cortex-A320 SoC面向工业和低功耗AIoT

    Amlogic A123X and C305X2 Arm Cortex-A320 SoCs target industrial and low-power AIoT applications

    Amlogic推出四核A123X与双核C305X2两款基于Arm Cortex-A320(Armv9.2-A、SVE2)的SoC,面向机器人、行车记录仪、IP摄像头、视频会议等工业及电池供电边缘AI与IoT场景。Amlogic成为首个发布Cortex-A320 SoC的芯片厂商。A123X支持4K 60fps H.264/H.265编码与4K 30fps解码,并集成4 TOPS ADLA2 NPU与8 TOPS ADLA3 NPU。官方…

    意义:Cortex-A320 首次商用落地,为低功耗边缘 AI 设备提供 Armv9 新选择,可能影响工业 AIoT 芯片选型与端侧 NPU 竞争格局。

  • 广告适用Apple苹果S12手表贴膜苹果WatchS12腕表保护膜42/46…新款·淘宝·苹果相关相关商品上架/在售信号淘宝¥13.8 · 精选自 全球电商每日爆款去看看
  • 资讯公开站CNX Software

    ACEMAGIC Kron Mini K5 评测第二部分:400 美元 Intel Core 3 304 迷你主机

    ACEMAGIC Kron Mini K5 Review – Part 2: A $400 Intel Core 3 304 Wildcat Lake mini PC tested with Windows 11 Pro

    这是 ACEMAGIC Kron Mini K5 迷你主机评测第二部分,在 Windows 11 Pro 下对搭载 Intel Core 3 304 五核处理器的机型进行深入测试,涵盖系统功能、AI 基准、4K/8K 视频播放、2.5GbE 与 WiFi 6 网络吞吐、散热、风扇噪音和功耗测量。

    意义:为关注低功耗迷你主机与边缘 AI 推理的开发者提供 Intel Wildcat Lake 平台在 Windows 11 下的实际性能、网络与散热参考数据。

  • 资讯公开站CNX Software

    Amlogic A311Y3 Cortex-A78/A55 边缘 AI 模块提供最高 8 TOPS 算力

    Amlogic A311Y3 Cortex-A78/A55 Edge AI system-on-module delivers up to 8 TOPS

    Boardcon CM311Y3 系统级模块基于 Amlogic A311Y3 八核 Cortex-A78/A55 SoC,集成最高 8 TOPS NPU,面向 4K 视频监控、AI 边缘计算、交互终端等,配备最高 16GB LPDDR5 与 256GB eMMC。

    意义:为边缘 AI 设备提供高算力、低功耗的国产 SoC 模块方案,便于开发者快速集成 4K 视觉与机器人应用。

  • 资讯公开站Entrepreneur

    多数创作者未充分利用的3个原生YouTube SEO工具

    3 Native YouTube SEO Tools Most Creators Don’t Leverage

    摘要显示,有效的YouTube SEO需要精简的工具。本文介绍了三个平台原生的功能,但大多数创作者未能充分利用这些功能来优化视频搜索排名。

    意义:帮助创作者和内容营销者了解并利用YouTube原生工具,提升视频搜索可见度,优化SEO策略。

  • 论文公开站arXiv

    LAION-BVD:千万小时级开放视频数据集,助力多模态预训练

    LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training

    LAION-BVD是LAION发布的大规模开放视频数据集,包含从CommonCrawl收集的13亿条平台视频URL,成功下载8000万段视频,总时长1000万小时。该数据集旨在支持视频、音频和图像多模态预训练,通过场景检测提取片段并合成字幕。基于此训练的模型在视频-文本和音频-文本基准上表现优异,且性能随规模提升。此外,提取的场景帧作为图像-文本数据源,展现出与网络图像不同的分布,模型在图像-文本检索上表现强劲。数据集已开源,显著扩大了…

    意义:为多模态预训练提供千万小时级开放视频资源,填补大规模视频数据空白,推动视频、音频、图像联合学习研究。

  • 广告适用于Apple苹果S12手表贴膜WatchS12腕表保护膜42/46m…新款·淘宝·苹果相关相关商品上架/在售信号淘宝¥13.8 · 精选自 全球电商每日爆款去看看
  • 资讯公开站Entrepreneur

    运营YouTube频道比想象中更耗时?三大耗时环节的优化策略

    Running a YouTube Channel Takes More Time Than You Think. Here’s How to Streamline the 3 Most Time-Consuming Parts.

    摘要显示,许多创作者低估了运营YouTube频道所需的时间投入,导致失败。文章针对最耗时的三个环节提出优化建议,帮助创作者避免这一陷阱,提高效率。

    意义:对内容创作者和视频平台开发者有参考价值,提示工具或服务可针对耗时环节优化,提升创作效率。

  • 开源项目公开站GitHub

    计算机科学视频课程列表

    Developer-Y/cs-video-courses — List of Computer Science courses with video lectures.

    这是一个GitHub仓库,收集了计算机科学领域的视频课程列表,目前拥有超过83000颗星标。该列表涵盖了广泛的CS主题,为学习者提供了丰富的视频资源。

    意义:为开发者提供一站式视频课程资源导航,方便自学和提升技能,是学习CS的宝贵参考。

  • 论文公开站arXiv

    ReWorld:具备长时记忆的交互式世界模型

    ReWorld: An Interactive World Model with Long-Horizon Memory

    摘要显示,ReWorld是一种交互式世界模型,通过混合注意力窗口和随机头路由,在训练时分离控制与记忆,推理时使用有界KV缓存和姿态索引地标库,实现长时记忆下的实时视频生成。数据引擎统一多源数据尺度,并通过LoRA蒸馏实现四步采样,在704x1280分辨率下实时生成,在动作跟随、长时记忆和视频质量方面优于六种现有模型。

    意义:ReWorld解决了交互式世界模型中控制与记忆的结构性矛盾,实现了长时记忆下的实时高保真视频生成,对虚拟现实、游戏和机器人仿真等应用具有重要意义。

  • 主题公开站Google News · GitHub

    GitHub 学习资源大合集:教程、工具和社区推荐

    摘要显示,本文为希望深入学习 GitHub 的读者汇总了优质学习资源,包括网站、书籍、视频、第三方工具和活跃社区,旨在帮助读者构建系统化的学习路径。

    意义:为开发者提供一站式GitHub学习导航,节省寻找资源时间,加速掌握协作与开源技能。

  • 广告众桦VST SV-0814H 8mm 机器视觉 镜头 500万像议价新款·淘宝·市场见机器视觉上架/在售信号淘宝¥720 · 精选自 全球电商每日爆款去看看
  • 开源项目公开站GitHub

    Deep-Live-Cam:单张图像实现实时换脸与一键视频深度伪造

    hacksider/Deep-Live-Cam — real time face swap and one-click video deepfake with only a single image

    Deep-Live-Cam 是一个开源项目,支持仅用单张图像进行实时换脸和视频深度伪造。该项目在 GitHub 上已获得约 96068 颗星,受到开发者广泛关注。其核心功能包括实时人脸交换和一键生成深度伪造视频,操作简便,但可能引发伦理和法律问题。

    意义:该项目降低了深度伪造技术的门槛,可能引发隐私、伦理和法律风险,同时也展示了 AI 在图像处理领域的强大能力,对开发者而言是双刃剑。