全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「Arm」共 17 条

  • 论文公开站arXiv

    Deep Learning for Sleep Heart Rate Estimation from Accelerometers: Toward Population-Scale Cardiac Insight Without Optic

    Large longitudinal cohorts often contain wrist accelerometry without optical heart-rate sensing, motivating recovery of cardiac information from motion signals already collected during sleep. We present SeqSmoother, a tr…

  • 论文公开站arXiv

    Revisiting Input Time-frequency Representations in Multi-pitch Estimation for Vocal Ensembles

    Multi-pitch estimation in vocal ensembles is challenging because singers occupy overlapping pitch ranges and often sing at closely spaced fundamental frequencies, causing their harmonics to overlap in time-frequency repr…

  • 论文公开站arXiv

    Rho:高效可适应VLA模型的基础

    Rho: A Foundation for Efficiently Adaptable VLA Models

    通用物理AI模型须结合广泛视觉语言能力与跨机器人本体的精确控制及高效下游适应。本文提出Rho系列开放权重VLA模型,用于双臂操作,专为数据高效适应设计。

  • 论文公开站arXiv

    神经调和测度算子

    Neural Harmonic Measure Operator

    我们提出神经调和测度算子(NHMO),一种用于变形状区域上椭圆偏微分方程问题的神经求解器。区域的调和测度是一种边界概率分布,与任意边界数据积分后即返回Dirichlet Laplace解。

  • 广告ASTA RESORT CAROLINA 上衣 26早秋新品 revol…有券新款样本,适合对照券后价与上架节奏再决定是否入手。淘宝¥1480 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    大语言模型用于结构化临床数据分析:双智能体接地与验证

    Large Language Models for Structured Clinical Data Analysis: Dual-Agent Grounding and Validation

    目标:开发并表征 CLEAR-Med,一种用于结构化临床数据自然语言分析的双智能体框架,将基于 SQL 的调用与独立验证分离。方法:CLEAR-Med 使用一个智能体将问题转化为可执行的结构化查询。

  • 论文公开站arXiv

    Kafila:在可信异构消费级机器集合上服务大语言模型

    Kafila: Serving Large Language Models on a Trusted Set of Heterogeneous Commodity Machines

    研究组成员或朋友圈各自拥有几台消费级计算机,但单台都不足以运行一个有能力的大语言模型。现有系统在开放集群中汇聚此类算力,而仅接纳可信机器的群体则无法使用。

  • 论文公开站arXiv

    ARCH-B:建筑表征、理解与层级基准

    ARCH-B: Architectural Representation, Comprehension and Hierarchy Benchmark

    多模态模型越来越多地解读视觉环境,但其在照片、平面图、立面图、剖面图和渲染图中识别同一建筑的能力仍缺乏表征。我们推出 ARCH-B,一个包含 354 道四选一题的基准。

  • 论文公开站arXiv

    RAPID:从演示中进行机器人智能体编程

    RAPID: Robot Agentic Programming from Demonstrations

    摘要显示,RAPID 面向机器人系统提出「从演示进行机器人智能体编程」方法,仅凭一次视觉人类演示,即可自动生成、验证并迭代优化机器人程序。其智能体循环依赖可测试任务规范、动作原语与可交互执行验证环境,三者均由演示自动推断。RAPID 采用以物体为中心的关系式程序表示,将动作原语表达为实现物体级运动效果的轨迹优化程序,并通过关系约束在运行时组合,从而提升跨物体位姿、形状、材质与环境的泛化能力。

    意义:该方法把编码智能体的自动验证与迭代能力引入机器人编程,降低示教门槛,并为可复用、可泛化的机器人技能生成提供新范式。

  • 广告MICHAEL KORS MK Hudson 男士老花双拉链相机包新款样本,适合先看规格与上架节奏再决定是否入手。淘宝¥2400 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    观察、回忆、行动:并发具身流中的常开机器人

    Watch, Recall, Act: Always-On Robots in Concurrent Embodied Streams

    摘要显示,论文针对「永远在线」机器人面临的持续指令流、场景变化与自身历史动作影响问题,提出 ARMS 流式策略:以预训练 π0.5 为骨干,叠加三个轻量模块,将实时感知、具身状态与自身过去动作转为上下文,异步更新使「看」与「忆」不阻塞「行动」,双臂可并发执行。作者构建 ARMS Dataset 以真实双臂遥操作自动标注各模块,联合任务达 45%,强基线为 28%,消融显示记忆模块、具身状态头与异步并发均必要。

    意义:为长时在线、可中断的具身智能体提供简单可扩展的流式上下文方案,异步并发设计对实时机器人系统有直接参考价值。

  • 论文公开站arXiv

    数学推理中顺序不变的答案与顺序敏感的表示

    Order-Invariant Answers, Order-Sensitive Representations in Mathematical Reasoning

    摘要显示,研究用合成多步函数复合任务测试16个1B至8B参数语言模型,在语义相同但规则顺序不同的题目下测量准确率与置换信噪比(SNR)。结果显示,能更准确解答重排问题的模型,其内部表征对不同规则顺序的区分度更高;层平均置换SNR与准确率在所有测试设置中均呈正秩相关,Spearman相关系数最高达0.86。研究据此提出应区分答案不变性与表征不变性。

    意义:提示开发者:模型答案正确不等于内部表征对顺序不敏感,评估数学推理时需关注表征层面的顺序敏感性。

  • 论文公开站arXiv

    扩展执行框架而非上下文:从无策略脚手架到可复用专家智能体

    Grow the Harness, Not the Context: From Strategy-Free Scaffolds to Reusable Specialist Agents

    摘要显示,该研究提出 Growing Harness 训练范式,从仅暴露固定模型与工具接口、不含任务求解控制器的无策略脚手架出发,利用函数级执行轨迹将失败定位到有限代码范围,由优化器联合修复一组失败,并以成功优先的留出集门控回滚有害修改,使控制结构从任务反馈中逐步涌现。在 BrowseComp-Plus 与 WebArena-Verified 及 4B 至 120B 三种模型上,六种设置中五种平均成功率最高,第六种落后最优 0.7 个百…

    意义:该工作把智能体控制逻辑沉淀为可复用代码而非反复填充上下文,显著降低调用次数与推理成本,并为小模型补齐长程任务能力提供新思路。

  • 论文公开站arXiv

    GPT模型中的危害洗白:性别歧视在安全训练中被转化而非减少

    Harm Laundering in GPT Models: Evidence That Gender Discrimination Is Transformed Rather Than Reduced Across Safety-Trained Generations

    摘要显示,研究分析GPT-2至GPT-5共15个模型、45万条性别指向生成内容,发现显性歧视内容在代际迭代中被转化而非移除,作者称之为「危害洗白」。GPT-2中针对女性的性暴力聚类在GPT-4后消失,但男性指向内容获得照护、情感表达等正向表征,女性指向内容则未获得。GPT-5中主题聚类将乳腺癌框定为男性权利议题,三个独立分类器均判其为非毒性;女性指向内容的主题多样性在GPT-4对齐边界相对男性下降36%。

    意义:提示仅靠表面毒性分类器评估安全对齐可能系统性漏检表征危害,开发者需引入主题多样性与表征危害指标。

  • 广告MICHAEL KORS MK Hudson 男士老花双层斜挎包胸包新款样本,适合先看规格与上架节奏再决定是否入手。淘宝¥2890 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    旗帜游戏:机制群体可解释性的玩具模型

    Flag Game: A Toy Model for Mechanistic Swarm Interpretability

    摘要显示,该论文提出 Flag Game 玩具模型,用于研究 AI 智能体集体信念形成的机制。模型以隐藏国旗为真值,每个受限智能体仅观察私有局部图像,但可交换信念并权衡同伴的社会证据。摘要称该模型复现了丰富的集体现象,包括性能随群体规模的非单调变化、社会意识提示与团队多样性带来的准确率提升,以及组织结构的影响,并识别出小规模下的集体信念崩溃随规模增长转为信念极化。论文还提出社会电路归因技术,通过因果干预验证其对集体动态关键智能体与观点的…

    意义:为多智能体集体行为的安全与对齐研究提供可解释性工具,社会电路归因有助于定位影响集体决策的关键智能体与观点。

  • 论文公开站arXiv

    智能体社会需要社会性治理框架

    Agentic Societies Need a Social Harness

    摘要显示,论文提出"智能体社会"概念,指多个AI智能体代表不同主体、跨信任边界自主协作。实验表明,即便诚实且能力足够的智能体,在现有 harness 与消息原语下也常无法达成满意结果;而故障或恶意智能体可通过通信("speech")漏洞拖延协作、影响结果并追求有害目标。作者主张除管理私有上下文与委托人通信的"个人 harness"外,还需"社会性 harness",并提出分层架构,实现失败预防、运行时无效消息检测与事后追责。

    意义:为多智能体系统提供跨信任边界的通信安全与追责设计思路,对构建可审计、抗攻击的智能体协作基础设施有直接参考价值。

  • 论文公开站arXiv

    生成评估中FID掩盖的偏差:检测、排序与诊断

    What FID Hides: Detecting, Ranking, and Diagnosing Deviations in Generative Evaluation

    摘要显示,生成模型常用FID和KID评估,但FID仅基于前两阶矩,可能忽略分布差异,且标量差距未校准采样变异。在ImageNet上,仅优化匹配Inception均值和协方差的不可识别图像,其FID为24.7,而保留的真实图像为58.6。FID和KID为对称标量,无法编码离散度变化方向。为此,引入ZID,结合六个位置和离散敏感指标,输出排序指数、置换p值和符号离散读数,以检测偏差并排序严重性。

    意义:为生成模型评估提供更全面的诊断工具,帮助开发者识别模型与真实数据的细微偏差,优化模型调优。

  • 论文公开站arXiv

    AI辅助如何影响人类技能发展:一项基于逻辑谜题的学习研究

    How AI Assistance Affects Human Skill Development: A Study of Learning with Logic Puzzles

    摘要显示,研究者通过逻辑谜题实验考察AI辅助对技能发展的影响。实验设置不同AI请求成本,发现低成本辅助导致更频繁使用AI。参与者在AI辅助阶段请求帮助后,在移除辅助后表现更差,且其后续无辅助表现被高估。贝叶斯潜在能力模型显示,独立解决问题的努力与能力提升正相关,表明AI替代独立推理会削弱技能发展。

    意义:对开发者与AI行业而言,此研究提示AI工具设计需平衡效率与用户长期技能发展,避免过度依赖导致能力退化,对AI辅助学习系统设计有重要参考价值。

  • 广告新品大码XXL 德国 Hudson Relax Fine 150D 棉混…新款样本,适合先看规格与上架节奏再决定是否入手。淘宝¥151.3 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    自精炼流水线中的非对称容量分配研究

    Asymmetric Capacity Allocation in Self-Refinement Pipelines

    自精炼(生成、批评、修订)是提升大模型生成能力的常用范式,但现有方法多将模型大小视为实现细节而非研究对象。本文首次对自精炼流程进行分阶段模型规模研究,基于Qwen3和Gemma 3的多个尺寸在5个基准上实验,发现较大生成器和修订者通常提升性能,而过小的修订者可能损害性能;批评者大小对性能影响不敏感,但包含小型批评者仍优于完全省略。

    意义:为多阶段LLM系统提供容量分配指导,避免资源浪费,助力构建计算高效的自精炼流水线。