全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「多模态」共 25 条

  • 论文公开站arXiv

    WorldAuditBench:多模态智能体的交互式3D世界审计

    WorldAuditBench: Interactive 3D World Auditing with Multimodal Agents

    随着交互式3D世界被广泛用于研究智能行为,识别其中异常(如悬浮物体、可穿墙、与环境不一致的物体)的高效流程变得重要,本文提出相应基准。

  • 论文公开站arXiv

    面向多模态临床诊断的排序感知提示优化

    Ranking-Aware Prompt Optimization for Multimodal Clinical Diagnosis

    多模态大模型正快速推进临床诊断,但其适配流程仍以准确率为目标。临床数据类别严重不平衡,恒定多数类预测器准确率可超90%却无临床价值。

  • 论文公开站arXiv

    交错强化学习让统一模型学会原生反思

    Learning Native Reflection in Unified Models with Interleaved Reinforcement Learning

    统一多模态模型既能看图又能生成图,原则上可自我修复生成结果:诊断错误、修改、观察再诊断;但修改是否有益只有渲染后才能知晓。

  • 资讯公开站rss_arxiv_cs_ai

    BioEVAL:面向生物工程的全球多机构大型语言与多模态模型基准

    BioEVAL: A global, multi-institutional benchmark of large language and multimodal models for bioengineering

    arXiv:2609.30489v1 公告类型:新 摘要:大型语言模型(LLM)在通用推理方面已取得历史性突破,并在生物医学科学中初获成功。然而,现有 LLM 基准测试侧重事实回忆,对模型在前沿和多模态任务上的表现洞察有限。我们构建了 BioEVAL(AI 与 LLM 的生物工程验证),这是一项全球多机构计划,旨在评估生物工程(BE)各子领域的实验推理能力。BioEVAL 涵盖 11 个主要 BE 子领域及一组未分类项目,汇集 22 个…

  • 广告罗伯特·卡沃利(ROBERTO CAVALLI) 女士 Logo比基尼下…有券·京东·市场见相关商品上架/在售信号京东¥1818.4 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    ARCH-B:建筑表征、理解与层级基准

    ARCH-B: Architectural Representation, Comprehension and Hierarchy Benchmark

    多模态模型越来越多地解读视觉环境,但其在照片、平面图、立面图、剖面图和渲染图中识别同一建筑的能力仍缺乏表征。我们推出 ARCH-B,一个包含 354 道四选一题的基准。

  • 论文公开站arXiv

    信还是不信:语音中的检索增强事实核查

    To Trust or Not to Trust: Retrieval-Augmented Fact Checking in Speech

    摘要显示,研究者提出 VeriSpeak,一个用于研究大型音频语言模型(LALM)语音事实核查能力的探针基准,包含 3,879 条口语化声明,覆盖时间、地理与关系类事实,真假标签均衡。实验发现文本与语音之间存在稳定的模态差距:能可靠核查书面声明的模型在同样内容以语音呈现时常常失败;仅靠检索收益有限,因为模型常将检索证据与语音声明混淆,而检索结合显式推理可提升声明-证据比对效果,思维调优的 LALM 达到 86.1% 准确率。

    意义:提示开发者:语音场景下事实核查不能简单复用文本能力,需重视跨模态差距与检索证据的显式推理比对。

  • 资讯公开站CNX Software

    CyboPal ONE——AI驱动、可随姿态调节的6自由度27英寸4K机器人终端(众筹)

    CyboPal ONE – An AI-powered, 6-DOF robotic terminal with 27-inch 4K display that adjusts to your posture (Crowdfunding)

    摘要显示,CyboPal ONE是一款6轴桌面机械终端,可承载27英寸4K显示屏,通过语音、手势、空间感知与用户位置自动调整屏幕姿态。设备配备摄像头、双目3D传感器与IMU,支持关节力感知、避障、碰撞检测与断电软着陆,机械臂臂展747mm,支持人脸追踪与位置记忆。内置Pauli智能体可语音控制屏幕定位、应用操作与文本输入,兼容Windows、macOS和Linux。主控为瑞芯微RK3588。

    意义:展示了RK3588等国产SoC在具身智能桌面终端的落地形态,为AI交互硬件开发者提供机械臂+多模态感知的参考设计。

  • 论文公开站arXiv

    我该加入哪里?语言引导目标预测的机器人群体加入

    Where Should I Join? Robot Group Joining via Language-Guided Goal Prediction

    摘要显示,社交导航通常假设目标已给定,而机器人加入群体需根据群体实时活动与队形预测加入位置。该工作提出语言引导的机器人群体加入任务:给定观测与目标群体的自然语言描述,机器人识别相关成员并预测符合社交规范的加入位姿。方法通过递归谱划分生成结构化候选子集,用语言条件图像-几何模型排序,再以人类队形先验生成多模态能量-朝向图。在对话、排队、观众场景中取得竞争性定位精度与亚秒级推理,加入位姿预测优于所有基线,并在真实机器人上验证。

    意义:为社交导航引入语言引导的群体加入能力,对导盲机器人、自主代步车等需要理解人群语义与队形的应用有直接价值。

  • 广告日本直邮Francesco Marino 男士 真丝佩斯利印花新款·淘宝·市场见相关商品上架/在售信号淘宝¥2333 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    DexTacWAM:面向灵巧操作的视触觉世界-动作模型

    DexTacWAM: A Visuo-Tactile World-Action Model for Dexterous Manipulation

    摘要显示,DexTacWAM 是一种视触觉世界-动作模型(WAM),将各指尖触觉独立编码,经手指与姿态感知的触觉压缩器聚合后注入视频扩散世界模型,实现视触觉联合世界建模。在 22 自由度双臂平台的六项富接触灵巧操作任务中均取得最高分,平均 70.6,最强基线为 38.0。消融表明收益来自将接触演化纳入预测世界状态,而非仅做触觉条件化。

    意义:把触觉纳入世界模型而非仅作条件输入,为富接触机器人操作提供了新范式,对具身智能与多模态世界模型研究有直接参考价值。

  • 论文公开站arXiv

    MIGU:面向操作规划的不确定性下多模态指令接地

    MIGU: Multimodal Instruction Grounding under Uncertainty for Manipulation Planning

    摘要显示,MIGU 是一个模块化框架,用于在语言与手势线索互补但不确定的情况下进行多模态指令接地。它通过眼-指几何传播视线方向与深度不确定性构建三维几何似然,并结合视觉语言模型提供的语义先验,以类贝叶斯方式融合为统一接地信念,进而支持直接规划或请求澄清。真实基准上 MIGU 优于所评估基线,消融实验支持显式多模态不确定性建模的收益。

    意义:为机器人在不确定语言与手势输入下提供可量化的接地与澄清机制,对具身智能与多模态规划有参考价值。

  • 资讯公开站Nature News

    科学家无需展开即可解读烧焦卷轴

    Watch scientists decipher burnt scrolls without unrolling them

    《自然》新闻报道显示,科学家利用成像与计算方法,在不打开被火山灰碳化的古卷的情况下读取其中的文字内容。摘要未提供具体技术细节、研究团队或所涉卷轴的名称,仅表明该工作展示了无损解读严重损毁文献的可行性。

    意义:无损读取碳化文献的技术路径,对文档理解、多模态扫描与文化遗产数字化等AI应用具有借鉴意义。

  • 资讯公开站EE Times

    重新定义边缘智能HMI:AI如何改变人机交互

    Redefining Intelligent HMI at the Edge: How AI Is Transforming Human-Machine Interaction 

    摘要显示,下一代人机交互(HMI)系统正从以触屏为中心向具备情境感知能力的智能体验演进,其驱动力来自边缘AI。该报道来自EE Times,指出这类系统不再局限于传统触控界面,而是能在边缘侧实现更智能的交互。原文未披露具体技术方案、厂商或性能数据。

    意义:提示开发者关注边缘AI在HMI中的落地路径,触屏之外的多模态与情境感知交互或成新竞争点。

  • 广告日本直邮Francesco Marino 男士 真丝印花领带 24新款·淘宝·市场见相关商品上架/在售信号淘宝¥2333 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    ERCPMP-Gx:用于结直肠息肉形态、组织病理与基因组表征的内镜图像视频数据集

    ERCPMP-Gx: Endoscopic Image and Video Dataset for Morphological, Histopathological, and Genomic Characterization of Colorectal Polyposis

    摘要显示,该数据集面向遗传性息肉病综合征的AI识别与分类,包含160张图像及配套视频片段,多数采用Olympus EVIS X1的白光、窄带成像、放大窄带成像与近聚焦模式采集。约八成病例为经临床或基因确诊的遗传性息肉病综合征(FAP、PJS、JPS、GNS),其余两成为形态重叠的非遗传性息肉及类息肉病变,用于鉴别分类,并关联组织病理与胚系检测信息。

    意义:为AI在内镜图像中区分遗传性与非遗传性息肉病提供多模态标注数据,有望推动结直肠癌早期筛查与个体化监测模型研发。

  • 主题公开站Google News · OpenAI

    OpenAI 最新功能解读:从函数调用到多模态

    摘要显示,该内容对 OpenAI 近期推出的新特性进行及时解读,涵盖函数调用、视觉能力与 JSON 模式等方向,旨在帮助读者跟上技术潮流。原文未给出具体版本号、发布时间或功能细节,仅作为 OpenAI 新特性的概览性介绍。

    意义:函数调用、视觉与 JSON 模式是构建可靠 AI 应用的关键能力,开发者可据此了解 OpenAI API 的能力边界与集成方式。

  • 论文公开站arXiv

    模态自回归的世界-动作模型

    Modality-Autoregressive World-Action Models

    摘要显示,该工作提出 ModAR,一种先在预测动作前自回归式去噪多种未来模态的世界-动作模型(WAM),使每次预测都能以先前生成的模态为条件。研究从零训练,系统考察训练数据混合、预测模态与 WAM 形式对性能的影响。结果显示,预测点轨迹、DINO 特征与深度图对 WAM 有益,而额外预测 RGB 并无一致收益;ModAR 的序列生成优于现有 WAM 形式,并在所有评估数据规模下取得最高平均成功率。

    意义:为具身智能与世界模型提供新范式:用点轨迹、DINO 特征、深度等模态替代 RGB 预测,可能显著降低训练算力并提升策略成功率。

  • 资讯公开站IEEE Spectrum Robotics

    AI 时代重新思考机器人安全

    Rethinking Robot Safety in the Age of AI

    随着 AI 与机器人技术快速发展,现代机器人通过多模态传感器感知环境、用 AI 模型理解情境并转化为物理行动。传统安全评估关注故障时的安全性,而物理 AI 带来新问题:当攻击者篡改机器人所见、所听或决策依据时,即使没有明显故障,机器人是否仍能保持安全?文章指出,这种对数据完整性的依赖可能产生传统评估无法捕捉的风险。

    意义:提醒开发者与AI行业:机器人安全评估需从传统故障安全扩展到对抗性数据攻击与物理AI的决策完整性。

  • 广告日本直邮UNIQLO优衣库 × Francesco Risso 联名款 …新款·淘宝·市场见相关商品上架/在售信号淘宝¥331 · 精选自 全球电商每日爆款去看看
  • 开源项目公开站GitHub

    Rerun:多模态机器人数据可视化与训练工具

    rerun-io/rerun — Visualize, query, and stream to train on multimodal robotics data.

    Rerun 是用于多模态机器人数据的开源工具,支持可视化、查询以及流式传输以用于训练,GitHub 星标数约 11457,帮助开发者处理机器人领域多模态数据流。

    意义:为机器人学习与多模态数据流处理提供可视化与查询基础设施,降低开发者调试和训练数据管线的门槛。

  • 论文公开站arXiv

    BioKERN:通过生物核正则化实现组织学-转录组学的邻域检索

    BioKERN: Biological Kernel Regularization for Histology-to-Transcriptomics Neighborhood Retrieval

    摘要介绍BioKERN,一种多模态空间表征学习框架,通过结合转录组相似性和空间邻近性构建训练时的生物核,提供分级邻域监督并正则化嵌入几何。在Mouse Brain Visium和Human Liver GSE240429数据集上,BioKERN在单尺度和多尺度设置下均优于BLEEP,且受控实验表明改进主要源于生物核正则化而非模型容量增加。

    意义:为空间生物学多模态学习提供可解释的归纳偏置,帮助开发者构建保留生物结构的表征,提升检索性能。

  • 论文公开站arXiv

    LAION-BVD:千万小时级开放视频数据集,助力多模态预训练

    LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training

    LAION-BVD是LAION发布的大规模开放视频数据集,包含从CommonCrawl收集的13亿条平台视频URL,成功下载8000万段视频,总时长1000万小时。该数据集旨在支持视频、音频和图像多模态预训练,通过场景检测提取片段并合成字幕。基于此训练的模型在视频-文本和音频-文本基准上表现优异,且性能随规模提升。此外,提取的场景帧作为图像-文本数据源,展现出与网络图像不同的分布,模型在图像-文本检索上表现强劲。数据集已开源,显著扩大了…

    意义:为多模态预训练提供千万小时级开放视频资源,填补大规模视频数据空白,推动视频、音频、图像联合学习研究。

  • 论文公开站arXiv

    老年人下肢骨折或髋关节置换术后功能恢复与社会隔离的多结局预测

    Predicting Multiple Clinical Outcomes Related to Functional Recovery and Social Isolation Among Older Adults After Lower-Limb Fracture or Hip Replacement

    摘要显示,该研究利用MAISON-LLF数据集,包含18名社区老年人的多模态传感器和临床评估数据,监测长达8周。提取46个日度特征,每两周评估5项临床结局。采用多输出回归算法联合预测临床评分,结果显示联合预测优于单独预测,其中NODE模型表现最佳(MSE=3.96,MAE=1.02)。SHAP分析强调了多模态传感器的重要性。

    意义:对开发者而言,该研究展示了多模态传感器数据在多输出回归中的潜力,可启发健康监测AI模型设计,提升对老年康复过程的综合评估能力。

  • 广告日本直邮UNIQLO优衣库 × Francesco Risso 联名款 …新款·淘宝·市场见相关商品上架/在售信号淘宝¥332 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    EG-ARSA:面向低资源场景的视觉道路安全审计开放专家模型

    EG-ARSA: An Expert-Grounded Open Model for Visual Road Safety Auditing in Low-Resource Settings

    该研究提出专家接地蒸馏(EGD)框架,将机构道路安全专业知识迁移至紧凑视觉语言模型,用于可扩展的视觉道路安全审计。通过量化校准阶段,教师模型与权威实地审计达成显著一致(Cohen's kappa=0.74)。蒸馏后的80亿参数学生模型采用低秩适应。研究还发布了首个开放专家接地的孟加拉道路安全审计数据集BD-ARSA,含21,947条图像审计记录,以及首个专为此任务开发的视觉语言模型EG-ARSA。实验显示,接地微调显著提升了序数风险评估…

    意义:为低资源环境提供可扩展的视觉道路安全审计方案,通过专家接地蒸馏提升模型可靠性,对AI在公共安全领域的落地具有示范意义。

  • 论文公开站arXiv

    Re³Cap:基于检索引导的强化学习图像描述优化方法

    Re$^3$Cap: Retrieval-Guided Refinement for Image Captioning Enhancement via Reinforcement Learning

    Re³Cap提出一种检索引导的推理策略,用于增强图像描述生成,无需额外标注。该方法通过描述细化建议器和质量评估器,识别并修正描述中的幻觉与遗漏,从而生成更准确、详细的描述。实验表明,在COCO-LN500基准上,Re³Cap在关系推理任务上平均比GRPO提升8.64%,甚至优于监督微调方法。

    意义:该方法利用多模态检索作为推理信号,提升强化学习在图像描述中的探索能力,为无需额外标注的模型优化提供了新思路。

  • 主题公开站Google News · LLM

    LLM未来趋势:多模态融合、自主Agent与AGI展望

    LLM的未来趋势:多模态、Agent与AGI展望

    摘要显示,LLM的发展方向包括多模态融合与自主Agent,这些技术将推动人工智能向AGI迈进。文章展望了这些趋势对未来AI的影响,并引发读者对技术演进和潜在挑战的思考。

    意义:帮助开发者把握LLM技术演进方向,关注多模态与Agent等关键领域,为产品研发和职业规划提供参考。

  • 论文公开站arXiv

    G-CARL:面向患者导向的医学报告解读的基于清单对齐的奖励学习框架

    G-CARL: Grounded Checklist-Aligned Reward Learning for Patient-Oriented Medical Report Interpretation

    摘要显示,研究者提出患者导向的医学报告解读(PMRI)任务,要求模型根据用户查询和对话历史,以准确且通俗的语言解释医学报告。为解决事实性和沟通性目标难以联合优化的问题,提出G-CARL框架,结合多源检索进行原子声明验证,并采用上下文感知的加权清单确保响应覆盖,从而提供结构化监督。同时构建了真实世界基准MMedReport和临床医生设计的三维评估协议,实验表明G-CARL在整体质量、声明级精度和清单达成率上优于现有基线。

    意义:为医学报告解读提供了兼顾事实性与用户沟通的强化学习框架,并引入新基准,对医疗AI的个性化交互和可验证生成有重要参考价值。

  • 广告现货代购意大利Matilde Vicenzi维西尼千层酥饼意大利酥皮奶油新款·淘宝·市场见相关商品上架/在售信号淘宝¥38 · 精选自 全球电商每日爆款去看看
  • 开源项目公开站GitHub

    Hugging Face Transformers:支持文本、视觉、音频及多模态模型的先进机器学习框架

    huggingface/transformers — 🤗 Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and multimodal models, for both inference and training.

    摘要显示,Hugging Face Transformers是一个用于定义最先进机器学习模型的框架,涵盖文本、视觉、音频及多模态模型,支持推理和训练。该项目在GitHub上拥有超过164k星标,表明其广泛的使用和社区认可。

    意义:作为AI模型开发的核心工具,Transformers库为开发者提供了统一的模型定义和训练接口,加速了多模态模型的部署,是AI工程实践的重要基础设施。