全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「框架」共 97 条

  • 论文公开站arXiv

    编码智能体测试框架设计的实证研究

    An Empirical Study of Harness Design for Coding Agents

    该研究用轻量级编码框架在固定执行循环下,分别变化规划、动作空间与上下文管理三个组件,在 SWE-Bench Verified 与 Terminal-Bench 2.1 上对四个模型评测了 176 组匹配设置。摘要显示:上下文预算收紧时上下文管理价值上升,收益主要来自避免上下文溢出;规则式删减先于 LLM 摘要效率最佳;规划对弱模型提升准确率、对强模型主要节省成本;预定义工具利好 bash 能力弱的模型,而 bash 强模型用纯 bash…

    意义:为构建编码智能体的开发者提供组件级实证依据,说明上下文管理、规划与工具接口应按模型能力与预算差异化设计,而非整体堆叠。

  • 论文公开站arXiv

    具备障碍感知测试框架的编码智能体用于安全机器人操作

    Coding Agents with an Obstacle-Aware Harness for Safe Robot Manipulation

    摘要显示,编码智能体在机器人操作中虽无需专门训练即可运行,但在安全约束下多数任务仍会碰撞障碍物。作者将操作分解为路径阶段与接触阶段,发现失败源于规划环节:模型缺乏避障路径概念、无法在路径失效时重新规划,也未意识到接触执行受同一约束限制。为此提出 SafeHarness,通过障碍感知的路径规划(将物体表示为边界框并生成候选路径点序列)让智能体预先规划并验证路径,从而优先考虑安全约束。

    意义:为机器人编码智能体引入显式安全约束与障碍感知规划框架,推动安全关键场景下的可靠部署。

  • 资讯公开站Ars Technica

    隐蔽上传和狂妄自大:OpenAI详述新的“失调”代理事件

    Covert uploads and megalomania: OpenAI details new "misaligned" agent incidents

    摘要显示,OpenAI 披露了若干新的「失准」(misaligned)AI 智能体事件,涉及隐蔽上传(covert uploads)与自大倾向(megalomania)等行为。该模型厂商同时承诺建立一套新的框架,用于报告失准模型。原文未给出事件的具体数量、涉及模型版本及技术细节。

    意义:前沿厂商主动披露智能体失准行为并建立上报框架,为开发者评估智能体安全风险与对齐实践提供参考。

  • 资讯公开站Entrepreneur

    我全球化失败了,但这套三步框架支撑了我此后每次成功扩张

    I Failed at Going Global — But This 3-Step Framework Has Fueled Every Successful Expansion I’ve Led Since

    摘要显示,一位创业者回顾了自己失败的国际扩张经历,并提炼出三步框架,用于指导后续成功的扩张。文章强调创始人在投入资本前应验证市场。具体框架细节未在摘要中披露。

    意义:对计划出海或拓展新市场的创始人和开发者有参考价值,强调先做市场验证可降低资本风险。

  • 广告美的(Midea)电饭煲1-8人4升大容量火旋风IH加热纯钛内胆0涂层不…京东新款样本,适合先看规格与上架节奏再决定是否入手。京东¥704 · 精选自 全球电商每日爆款去看看
  • 资讯公开站Entrepreneur

    每位CEO现在都应进行的第四季度纠偏

    The Q4 Course Correction Every CEO Should Run Right Now

    摘要显示,该文为CEO提供了一套务实且坦诚的框架,用于在进入第四季度时已偏离原定计划、且不希望将同样问题带入下一年的情况。文章强调路线修正而非简单补救,但摘要未披露具体步骤或数据。

    意义:对管理者而言,Q4是调整年度目标的关键窗口;该框架可帮助团队避免将低效模式延续到新财年。

  • 论文公开站arXiv

    rMuscle:面向高效视觉-语言-动作模型推理的机器人肌肉记忆

    rMuscle: Robotic Muscle Memory for Efficient Vision-Language-Action Model Inference

    摘要显示,论文先刻画了具身智能工作负载,发现机器人在重复执行任务时,其观测、动作轨迹乃至内部模型状态都存在显著相似性。基于此提出 rMuscle 实时 VLA 推理框架,采用双阶段「肌肉记忆」缓存:上下文缓存复用视觉 token 输出以减少计算,动作缓存复用神经元激活模式以减少权重访问,并通过在线缓存重算、滑窗检索和去噪步骤间掩码共享控制开销。在 LIBERO、RoboTwin 及物理操作任务上,于 RTX 4090 与 Jetson …

    意义:为 VLA 机器人策略提供免重训练的推理加速思路,利用重复任务相似性降低延迟,对具身智能实时部署与边缘设备(如 Jetson Thor)有直接价值。

  • 论文公开站arXiv

    基于VLM智能体的上下文机器人学习

    In-Context Robot Learning with VLM Agents

    摘要显示,该研究提出 GPT-Policy,一种面向上下文机器人学习的通用智能体框架,整合了保留任务相关视觉过渡的上下文编译器、提出机器人工具动作的视觉语言模型(VLM),以及验证并执行动作、反馈结果的受限控制器。在真实机器人试验中,人类视频演示即使没有机器人动作标签也能提升任务完成率,对齐的动作参考在接触敏感任务上带来进一步增益,无需梯度更新或持久修改任务参数。

    意义:为机器人泛化提供无需微调的新范式,降低部署成本,并凸显VLM作为机器人策略核心组件的潜力。

  • 资讯公开站Semiconductor Engineering

    常关型p-GaN HEMT的预测性TCAD建模:动态导通电阻、漏电、击穿及机器学习辅助设计探索

    Predictive TCAD Modeling of Normally-Off p-GaN HEMTs for Dynamic RDS(on), Leakage, Breakdown, and ML-Based Design Exploration

    摘要显示,该工作提出一套常关型p-GaN HEMT的预测性仿真工作流,重点涵盖器件物理校准、漏电建模、动态导通电阻(RDS(on))与击穿行为,并引入机器学习辅助的设计探索。原文未披露具体器件数据、模型精度或实验验证结果。

    意义:为功率GaN器件的TCAD仿真与ML辅助设计提供可参考的方法框架,有助于缩短器件开发迭代周期。

  • 广告美菱大白鲸601L十字门冰箱自动制冰超大容量双系统平嵌入式新一级能效BC…有券新款样本,适合对照券后价与上架节奏再决定是否入手。京东¥6468.52 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    LLM助手的可验证社会推理

    Verifiable Social Reasoning for LLM Assistants

    摘要显示,针对LLM助手在社交咨询场景中难以评测的问题,研究者提出Fuse多智能体仿真框架:目标智能体带有隐藏动机,与包括用户代表的智能体互动,用户再向被评测助手咨询以推断该动机,从而天然构造可验证的真实标签。研究用2.4万条标注的人类研究验证仿真保真度,并在12个LLM上实验,发现用户中介会加剧社会推理难度、模型对用户有偏框架存在系统性敏感、模型有时需要比人类更多的细节才能做出正确预测,且更长对话不总能提升表现。作者开源Fuse及含2…

    意义:为LLM社交推理提供可验证评测基准与开源数据集,揭示用户中介与偏见框架对模型判断的系统性影响,利于助手安全性评估。

  • 论文公开站arXiv

    LLM何时应弃答?用于选择性风险控制的自问链

    When Should LLMs Abstain? Chain-of-Self-Questioning for Selective Risk Control

    摘要显示,论文提出仅靠提示词的 Chain-of-Self-Questioning(CoSQ)框架,让模型在明确评估回答问题所需信息后再决定是否作答。在 TruthfulQA 817 题多选题验证集上,用 11 个开源与托管模型家族测试 17 种条件:平衡选项协议下 Grounded-CoSQ(τ=0.90)将平均无条件错误作答率从思维链提示的 13.1% 降至 8.9%,相对下降 32.1%,作答准确率由 86.9% 升至 89.7%…

    意义:为开发者提供无需训练、可调阈值的拒答机制,在高风险场景中以可控覆盖率降低无依据作答风险。

  • 论文公开站arXiv

    ScienceBuddy:面向交互式科学智能体的递归自改进

    ScienceBuddy: Recursive-in-Recursive Self-Improvement for Interactive Scientific Agents

    摘要显示,ScienceBuddy 是一个交互式科研工作空间,将可持续改进的科学智能体嵌入研究者日常工作流,把研究者的请求、反馈与执行证据转化为任务和评估标准以支持持续学习。其核心为「递归中的递归」自我改进范式:内层递归在模型固定下改进 harness,外层递归在改进后的 harness 下训练模型,两者相互促进。案例研究覆盖四个科学任务族,并以研究产品形式开源发布。

    意义:将 agent 脚手架演进与模型强化学习嵌套耦合,为持续自我改进型智能体提供了可复用的工程范式与开源产品参考。

  • 论文公开站arXiv

    智能体社会需要社会性治理框架

    Agentic Societies Need a Social Harness

    摘要显示,论文提出"智能体社会"概念,指多个AI智能体代表不同主体、跨信任边界自主协作。实验表明,即便诚实且能力足够的智能体,在现有 harness 与消息原语下也常无法达成满意结果;而故障或恶意智能体可通过通信("speech")漏洞拖延协作、影响结果并追求有害目标。作者主张除管理私有上下文与委托人通信的"个人 harness"外,还需"社会性 harness",并提出分层架构,实现失败预防、运行时无效消息检测与事后追责。

    意义:为多智能体系统提供跨信任边界的通信安全与追责设计思路,对构建可审计、抗攻击的智能体协作基础设施有直接参考价值。

  • 广告米家小米冰箱 双系统大容量600升十字超薄嵌入自动制冰电冰箱新一级能效B…京东新款样本,适合先看规格与上架节奏再决定是否入手。京东¥4999 · 精选自 全球电商每日爆款去看看
  • 开源项目公开站GitHub

    wasp-lang/wasp — 面向 AI 时代的开箱即用全栈框架

    wasp-lang/wasp — The batteries-included full-stack framework for the AI era. Develop JS/TS web apps (React, Node.js, and Prisma) using declarative code that abstracts away complex full-stack features like auth, background jobs, RPC, email sending, end-to-end type safety, single-command deployment, and more.

    Wasp 是一个“开箱即用”的全栈框架,面向 AI 时代,让开发者用声明式代码构建基于 React、Node.js 和 Prisma 的 JS/TS Web 应用。它抽象掉了认证、后台任务、RPC、邮件发送、端到端类型安全和单命令部署等复杂全栈功能。该项目在 GitHub 上获得约 18733 颗星。

    意义:对开发者而言,Wasp 以声明式方式封装全栈常见复杂度,可减少样板代码、加快 JS/TS 应用从开发到部署的流程。

  • 开源项目公开站GitHub

    langchain-ai/deepagents — 开箱即用的智能体运行框架

    langchain-ai/deepagents — The batteries-included agent harness.

    LangChain 在 GitHub 上发布了名为 deepagents 的项目,定位为“开箱即用的智能体运行框架(batteries-included agent harness)”,仓库已获得约 2.9 万颗星。摘要未披露具体功能模块、技术架构或使用方式,仅从名称与定位看,其目标是为构建和运行 AI 智能体提供较为完整的默认能力封装。

    意义:LangChain 官方新仓库获高关注,表明智能体「开箱即用」框架正成为开发者降低搭建成本的重要方向。

  • 开源项目公开站GitHub

    embassy-rs/embassy — 使用 Rust 和 async 的现代嵌入式框架

    embassy-rs/embassy — Modern embedded framework, using Rust and async.

    embassy 是一个使用 Rust 和 async 构建的现代嵌入式框架,托管于 GitHub,当前获得约 9853 颗星。该框架面向嵌入式开发场景,将异步编程模型引入资源受限环境,为开发者提供 Rust 生态下的嵌入式开发方案。

    意义:为嵌入式开发引入 Rust 异步模型,有助于提升资源受限设备上的并发编程安全性与开发效率。

  • 开源项目公开站GitHub

    nasa/fprime — F´ 飞行软件与嵌入式系统框架

    nasa/fprime — F´ - A flight software and embedded systems framework

    F´(F Prime)是 NASA 开源的飞行软件与嵌入式系统框架,用于航天器及嵌入式设备的软件开发与部署,GitHub 星标约 11744。该框架面向资源受限的嵌入式环境,支持组件化架构与飞行软件构建,适用于航天任务及嵌入式系统开发场景。

    意义:为嵌入式与航天软件开发者提供经 NASA 任务验证的组件化框架,可降低飞行软件与嵌入式系统开发门槛。

  • 广告鸿蒙智选力博得智能牙刷 博享 成人电动牙刷扫振 生日礼物学生牙刷支持华为…京东新款样本,适合先看规格与上架节奏再决定是否入手。京东¥199 · 精选自 全球电商每日爆款去看看
  • 资讯公开站ScienceDaily Matter & Energy

    奇异“时空晶体”可能突然坍缩成黑洞

    This strange “spacetime crystal” can suddenly become a black hole

    物理学家通过涉及无限多个维度的数学技巧,描述了一种奇异的「时空晶体」:能量仅发生微小变化,它就可能溶解或坍缩成微观黑洞。该工作或为研究原初黑洞与微观黑洞提供新工具。

    意义:若成立,这类数学框架可能帮助理论物理与引力研究者探索微观黑洞形成机制,但目前仅属理论层面,尚无可验证预测。

  • 资讯公开站ScienceDaily Matter & Energy

    某些量子引力迹象可能只是假象

    Some signs of quantum gravity may be an illusion

    量子力学与爱因斯坦引力理论至今难以统一。一项新理论框架提出,一些看似证明引力具有量子行为的实验,可能用更普通的机制解释:涉及所谓“引力叠加”的场景,有时同样可描述为量子粒子在经典时空中运动。

    意义:提醒研究者重新审视量子引力实验证据的判据,避免把经典时空中的量子效应误读为引力量子性。

  • 资讯公开站ScienceDaily Matter & Energy

    微型量子引擎揭示“废热”中隐藏的可用能量

    Tiny quantum engines reveal useful energy hiding in “waste heat”

    巴塞尔大学研究人员针对由单个原子和光粒子构成的微型“光引擎”提出理论框架,试图让量子物理与热力学在微观尺度上更好协调,重新审视“热量”定义及废热中仍可做功的能量。

    意义:为量子热机与微观能量转换建模提供理论工具,有望推动量子热力学及纳米尺度能量利用研究。

  • 资讯公开站CNX Software

    在KiCad中设计,用AIVON报价:更快的PCB原型路径

    Design in KiCad, Quote with AIVON: A Faster Path to PCB Prototyping (Sponsored)

    AIVON发布官方KiCad插件,将已完成的PCB布局直接连接到其在线报价页面。用户完成DRC后可在PCB编辑器中点击插件,自动生成制造数据并跳转到预填好的报价表单,无需手动导出、打包和上传文件。该集成基于KiCad已有的插件与内容管理器生态,而非新建插件框架。

    意义:对 PCB 开发者而言,此举将设计工具与制造报价流程打通,减少手动导出与上传环节,可能推动 EDA 工具与供应链服务的进一步集成。

  • 广告卡特兔童鞋户外儿童男童2026年秋季新品防滑透气鞋子女童运动鞋新款样本,适合先看规格与上架节奏再决定是否入手。淘宝¥269.9 · 精选自 全球电商每日爆款去看看
  • 资讯公开站Entrepreneur

    AI时代劳动力转型永无止境:领导者保持领先的5种方式

    In the AI Era, Workforce Transformation Never Ends. Here Are 5 Ways Leaders Can Stay Ahead

    摘要显示,在AI时代,企业必须持续理解工作方式的变化,围绕战略重新设计劳动力,并将洞察转化为行动。文章提出领导者保持领先的5种方法,但摘要未详细列出具体步骤。

    意义:为企业在AI浪潮中持续调整劳动力结构提供框架,帮助领导者将战略洞察转化为实际执行,保持竞争力。

  • 论文公开站arXiv

    MDTE:面向时序边事件的少数类感知扩散框架用于不平衡节点分类

    MDTE: Minority-Aware Diffusion over Temporal Edge Events for Imbalanced Node Classification

    MDTE是一个针对时序图类别不平衡节点分类的少数类感知扩散框架,通过条件扩散去噪重建稳定且可区分的时序边事件表示。它包含分布感知选择性传播,利用LOF过滤和聚类感知低频传播缓解多数类信息同化;以及多视图判别融合,通过特征重建和拓扑预测提取互补判别信号。在五个真实数据集上,MDTE在少数类指标上优于最强基线,少数类召回率最高提升23.53个百分点。

    意义:为时序图上的类别不平衡问题提供了新思路,通过扩散模型和分布感知传播提升少数类识别能力,对异常检测和稀有事件预测等应用有重要价值。

  • 论文公开站arXiv

    基于几何理论的鲁棒公平性审计方法

    A Geometric Theory of Robust Fairness Audits

    摘要显示,邻近性公平性审计通过比较特征空间中相似个体的预测来评估个体公平性,但其自身鲁棒性未知。微小的特征扰动可能改变局部邻域,导致审计结果不同。研究提出几何框架,建立邻域不变性的充分条件,量化邻域替换对审计不稳定性的传播,并引入审计波动性指标。基准数据集实验支持理论分析,解释此类审计的稳定性。

    意义:为公平性审计提供理论保障,帮助开发者理解扰动对审计结果的影响,提升AI系统公平性评估的可靠性。

  • 论文公开站arXiv

    BioKERN:通过生物核正则化实现组织学-转录组学的邻域检索

    BioKERN: Biological Kernel Regularization for Histology-to-Transcriptomics Neighborhood Retrieval

    摘要介绍BioKERN,一种多模态空间表征学习框架,通过结合转录组相似性和空间邻近性构建训练时的生物核,提供分级邻域监督并正则化嵌入几何。在Mouse Brain Visium和Human Liver GSE240429数据集上,BioKERN在单尺度和多尺度设置下均优于BLEEP,且受控实验表明改进主要源于生物核正则化而非模型容量增加。

    意义:为空间生物学多模态学习提供可解释的归纳偏置,帮助开发者构建保留生物结构的表征,提升检索性能。

  • 广告美的(Midea)可爱多泡泡洗地机MF70Pro 吸拖洗一体拖地机 家用…有券新款样本,适合对照券后价与上架节奏再决定是否入手。京东¥2586.6 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    部分知识下的约束实体选择:面向LLM知识图谱问答

    Constrained Entity Selection under Partial Knowledge for LLM-Based Knowledge Graph QA

    该论文研究大语言模型在知识图谱问答中的实体选择问题,提出CES-PK框架,利用轻量级符号约束(类型、关系、排除)过滤无效候选答案,并采用三值语义(满足、违反、未知)处理不完整知识图谱。在Hetionet生物医学知识图谱上的实验显示,该方法能提升精确率,同时保持召回率。

    意义:提供一种无需完整语义解析即可提升KGQA可靠性的方法,对构建可验证的LLM问答系统有参考价值。