全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「CT」共 277 条

  • 论文公开站arXiv

    PhysStream:具结构化场景记忆与细粒度运动控制的流式物理视频生成

    PhysStream: Streaming Physics-Grounded Video Generation with Structured Scene Memory and Fine-Grained Motion Control

    摘要显示,PhysStream 是一种自回归图像到视频生成模型,面向物理落地的动态场景合成。它引入结构化场景记忆(位置图与目标跟踪图,由已生成帧在线推导),并用稀疏速度增量信号编码物理量实现细粒度运动控制。模型分两阶段训练:先对双向模型做运动控制条件微调,再训练带场景记忆的因果自回归模型。摘要称其在桌面刚体多物体场景中支持生成中途交互控制,合成基准上 FVMD 降低 33%、轨迹误差降低 12%,人类评估中超过 85% 的对比更受偏好。

    意义:为视频生成引入可在线更新的场景记忆与物理量级控制信号,使生成过程可中途干预,对交互式世界模型与可控视频生成方向有参考价值。

  • 论文公开站arXiv

    ScienceBuddy:面向交互式科学智能体的递归自改进

    ScienceBuddy: Recursive-in-Recursive Self-Improvement for Interactive Scientific Agents

    摘要显示,ScienceBuddy 是一个交互式科研工作空间,将可持续改进的科学智能体嵌入研究者日常工作流,把研究者的请求、反馈与执行证据转化为任务和评估标准以支持持续学习。其核心为「递归中的递归」自我改进范式:内层递归在模型固定下改进 harness,外层递归在改进后的 harness 下训练模型,两者相互促进。案例研究覆盖四个科学任务族,并以研究产品形式开源发布。

    意义:将 agent 脚手架演进与模型强化学习嵌套耦合,为持续自我改进型智能体提供了可复用的工程范式与开源产品参考。

  • 论文公开站arXiv

    模态自回归的世界-动作模型

    Modality-Autoregressive World-Action Models

    摘要显示,该工作提出 ModAR,一种先在预测动作前自回归式去噪多种未来模态的世界-动作模型(WAM),使每次预测都能以先前生成的模态为条件。研究从零训练,系统考察训练数据混合、预测模态与 WAM 形式对性能的影响。结果显示,预测点轨迹、DINO 特征与深度图对 WAM 有益,而额外预测 RGB 并无一致收益;ModAR 的序列生成优于现有 WAM 形式,并在所有评估数据规模下取得最高平均成功率。

    意义:为具身智能与世界模型提供新范式:用点轨迹、DINO 特征、深度等模态替代 RGB 预测,可能显著降低训练算力并提升策略成功率。

  • 论文公开站arXiv

    智能体社会需要社会性治理框架

    Agentic Societies Need a Social Harness

    摘要显示,论文提出"智能体社会"概念,指多个AI智能体代表不同主体、跨信任边界自主协作。实验表明,即便诚实且能力足够的智能体,在现有 harness 与消息原语下也常无法达成满意结果;而故障或恶意智能体可通过通信("speech")漏洞拖延协作、影响结果并追求有害目标。作者主张除管理私有上下文与委托人通信的"个人 harness"外,还需"社会性 harness",并提出分层架构,实现失败预防、运行时无效消息检测与事后追责。

    意义:为多智能体系统提供跨信任边界的通信安全与追责设计思路,对构建可审计、抗攻击的智能体协作基础设施有直接参考价值。

  • 广告小米(MI)路由器 BE7200 Pro 新品路由器 家用 AI抗干扰 …有券新款样本,适合对照券后价与上架节奏再决定是否入手。京东¥935.1 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    MDTE:面向时序边事件的少数类感知扩散框架用于不平衡节点分类

    MDTE: Minority-Aware Diffusion over Temporal Edge Events for Imbalanced Node Classification

    MDTE是一个针对时序图类别不平衡节点分类的少数类感知扩散框架,通过条件扩散去噪重建稳定且可区分的时序边事件表示。它包含分布感知选择性传播,利用LOF过滤和聚类感知低频传播缓解多数类信息同化;以及多视图判别融合,通过特征重建和拓扑预测提取互补判别信号。在五个真实数据集上,MDTE在少数类指标上优于最强基线,少数类召回率最高提升23.53个百分点。

    意义:为时序图上的类别不平衡问题提供了新思路,通过扩散模型和分布感知传播提升少数类识别能力,对异常检测和稀有事件预测等应用有重要价值。

  • 论文公开站arXiv

    有效学习率主导语言模型预训练中的损失动态

    Effective Learning Rate Governs Loss Dynamics in Language Model Pretraining

    摘要显示,在语言模型预训练中发现有效学习率(ELR)坍缩现象:学习率与参数范数主要通过其比值(即有效学习率)影响损失动态。当ELR匹配时,不同运行间的损失轨迹在整个训练过程中坍缩,尽管学习率和参数范数差异显著。跨优化器、架构、数据集和模型规模,平均坍缩误差通常为几乘以10^-3,低于代表性配置中种子间变异。系统消融表明,归一化设计和学习率-范数变化的时间尺度是坍缩精度的关键决定因素。受控干预进一步显示,权重衰减和超球形状主要通过其诱导的…

    意义:为语言模型预训练提供统一的优化视角,有助于改进学习率调度与范数控制策略,提升训练效率与可预测性。

  • 论文公开站arXiv

    部分知识下的约束实体选择:面向LLM知识图谱问答

    Constrained Entity Selection under Partial Knowledge for LLM-Based Knowledge Graph QA

    该论文研究大语言模型在知识图谱问答中的实体选择问题,提出CES-PK框架,利用轻量级符号约束(类型、关系、排除)过滤无效候选答案,并采用三值语义(满足、违反、未知)处理不完整知识图谱。在Hetionet生物医学知识图谱上的实验显示,该方法能提升精确率,同时保持召回率。

    意义:提供一种无需完整语义解析即可提升KGQA可靠性的方法,对构建可验证的LLM问答系统有参考价值。

  • 论文公开站arXiv

    双维度LLM框架用于大规模测评中题目非内容相似性自动分析

    A Dual-Dimensional LLM Framework for Automated Item Incidental Content Similarity Analysis in Large-Scale Assessments

    该研究提出一种基于大语言模型的双维度自动题目相似性分析框架,通过结构化分解和语义相关性来检测题目中非内容冗余。心理测量验证显示,LLM指标比传统文本指标更接近构念无关局部依赖,并产生更一致的题目参数分组。在计算机自适应测试中,基于LLM的相似性约束提高了估计稳定性并减少了偏差。

    意义:为大规模题库管理提供新方法,提升自适应测试的准确性和效率,对教育测评AI应用有重要价值。

  • 广告小米(MI)路由器 BE7200 Pro 新品路由器 家用 AI抗干扰 …有券新款样本,适合对照券后价与上架节奏再决定是否入手。京东¥935.1 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    读取不等于使用:检索、判断与AI金融研究工作流的设计

    Reading Is Not Using: Retrieval, Judgment, and the Design of AI Financial Research Workflows

    摘要显示,大型语言模型在金融分析中的评估通常基于检索能力,而非检索信息对判断的影响。研究发现,在长上下文金融分析中存在“检索-整合缺口”:当无关上下文从2000增至128000个token时,风险披露对投资判断的影响降至噪声水平,尽管直接检索仍准确。该现象在多个模型家族和任务中复现,且更强大的模型仅推迟而非消除此缺口。因果记忆干预表明,压缩摘要和源文本查找共同传递披露信息,而工作流架构(如分块-总结流水线会逐出相关信息)决定传递成败。因…

    意义:对AI行业而言,提示了仅靠检索评估的不足,强调工作流设计对模型实际决策的影响,为金融AI系统开发提供关键考量。

  • 论文公开站arXiv

    通过局部增强偏好与表示解缠改进跨问题车辆路径规划

    Improving Cross-Problem Vehicle Routing with Locally Augmented Preferences and Representation Disentanglement

    摘要显示,多任务车辆路径问题求解器面临训练监督弱和架构纠缠的挑战。为此,提出POLAR训练算法,通过局部搜索细化最佳解码路径以形成更优偏好对,以及PLE编码器,利用门控机制分离共享专家与任务特定专家,逐步解缠通用路由结构与约束特定编码。实验表明,两者结合可提升当前最先进性能。

    意义:对开发者而言,该研究提供了训练算法与架构设计的改进,有望提升多任务VRP模型的泛化能力与训练效率,推动实际物流调度应用。

  • 论文公开站arXiv

    SPO++:面向异步智能体强化学习的流对齐策略优化

    SPO++: Stream-Aligned Policy Optimization for Asynchronous Agentic RL

    摘要介绍SPO++,一种改进的异步智能体强化学习算法。针对组相对强化学习等待同提示兄弟rollout的高成本,SPO使用持久提示级价值估计,但轨迹中心化未能正确居中行动者消费的token加权量。SPO++通过标准化行动token度量下的终端结果优势来修正,并依据策略事件而非接收顺序组织提示证据。在ALFWorld和Math-TIR上的实验显示,SPO++相比SPO提升了在线学习效率,消融实验表明行动token度量归一化是最有效的组件。

    意义:为异步智能体强化学习提供更高效的策略优化方法,减少等待成本,提升在线学习效率,对长工具使用轨迹的智能体训练有重要意义。

  • 论文公开站arXiv

    递归经验-工作记忆演化:面向长周期智能体框架的自我改进架构

    Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses

    摘要介绍Recuris架构,通过工作记忆追踪任务进度并引导技能选择,将执行转化为结构化证据,定位失败至记忆组件。固定元代理将证据转化为局部验证的更新,形成有界递归记忆演化循环。在四个长周期基准和十个模型上,35/37对任务成功提升,如tau-bench上GPT-5.6 Sol提升17.8点,Claude Opus 5提升15.6点至87.9%。

    意义:为长周期智能体提供可扩展的递归自我改进机制,显著提升任务成功率,对AI代理的长期自主性发展具有重要意义。

  • 广告华为路由器WiFi7全千兆路由器穿墙王BE3pro家用全屋WiFi漏油器…京东新款样本,适合先看规格与上架节奏再决定是否入手。京东¥519.01 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    生成评估中FID掩盖的偏差:检测、排序与诊断

    What FID Hides: Detecting, Ranking, and Diagnosing Deviations in Generative Evaluation

    摘要显示,生成模型常用FID和KID评估,但FID仅基于前两阶矩,可能忽略分布差异,且标量差距未校准采样变异。在ImageNet上,仅优化匹配Inception均值和协方差的不可识别图像,其FID为24.7,而保留的真实图像为58.6。FID和KID为对称标量,无法编码离散度变化方向。为此,引入ZID,结合六个位置和离散敏感指标,输出排序指数、置换p值和符号离散读数,以检测偏差并排序严重性。

    意义:为生成模型评估提供更全面的诊断工具,帮助开发者识别模型与真实数据的细微偏差,优化模型调优。

  • 论文公开站arXiv

    老年人下肢骨折或髋关节置换术后功能恢复与社会隔离的多结局预测

    Predicting Multiple Clinical Outcomes Related to Functional Recovery and Social Isolation Among Older Adults After Lower-Limb Fracture or Hip Replacement

    摘要显示,该研究利用MAISON-LLF数据集,包含18名社区老年人的多模态传感器和临床评估数据,监测长达8周。提取46个日度特征,每两周评估5项临床结局。采用多输出回归算法联合预测临床评分,结果显示联合预测优于单独预测,其中NODE模型表现最佳(MSE=3.96,MAE=1.02)。SHAP分析强调了多模态传感器的重要性。

    意义:对开发者而言,该研究展示了多模态传感器数据在多输出回归中的潜力,可启发健康监测AI模型设计,提升对老年康复过程的综合评估能力。

  • 论文公开站arXiv

    交互税:多智能体团队中的通信如何抹杀多样性

    The Interaction Tax: When Communication Erases Diversity in Multi-Agent Teams

    摘要显示,多智能体LLM交互效果不一,部分研究显示辩论、批评循环等有增益,但另一些在同等预算下无改进。作者提出“交互税”概念:当智能体读取完整输出时,一轮内提案趋同,抹杀多样性。在11个验证器评分优化任务中,完整解决方案交互为弱默认,独立生成可避免崩溃;批评仅在规则易找易修时有效。

    意义:该研究揭示多智能体性能的关键在于信息交换类型而非数量,对设计高效多智能体系统、避免无效交互成本具有指导意义。

  • 论文公开站arXiv

    AI辅助如何影响人类技能发展:一项基于逻辑谜题的学习研究

    How AI Assistance Affects Human Skill Development: A Study of Learning with Logic Puzzles

    摘要显示,研究者通过逻辑谜题实验考察AI辅助对技能发展的影响。实验设置不同AI请求成本,发现低成本辅助导致更频繁使用AI。参与者在AI辅助阶段请求帮助后,在移除辅助后表现更差,且其后续无辅助表现被高估。贝叶斯潜在能力模型显示,独立解决问题的努力与能力提升正相关,表明AI替代独立推理会削弱技能发展。

    意义:对开发者与AI行业而言,此研究提示AI工具设计需平衡效率与用户长期技能发展,避免过度依赖导致能力退化,对AI辅助学习系统设计有重要参考价值。

  • 广告有人(LonHand)4G插卡工业路由器 多网口无线路由器通5网口路由器…有券新款样本,适合对照券后价与上架节奏再决定是否入手。京东¥479.61 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    惯性流形神经算子用于耗散时间相关偏微分方程

    Inertial Manifold Neural Operator for Dissipative Time-Dependent Partial Differential Equations

    本文提出惯性流形神经算子(IMNO),用于求解耗散时间相关偏微分方程。摘要显示,该算子利用耗散系统的低维结构,相比标准神经算子(如傅里叶神经算子)在长时间自回归训练和预测中具有更好的物理可解释性、准确性和稳定性。针对平移等变PDE,还提出了平移等变变体(IMNO-SE),通过保持对称性提升性能。

    意义:为耗散PDE的长期预测提供更稳定、可解释的神经算子,并引入对称性保持的归纳偏置,对科学计算和AI4Science有重要意义。

  • 论文公开站arXiv

    训练时数据污染对工业控制系统异常检测模型鲁棒性的影响评估

    Robustness of Anomaly Detection Models for Industrial Control Systems under Training-Time Data Contamination

    该研究评估了工业控制系统(ICS)中基于机器学习的异常检测模型在训练数据受污染时的鲁棒性。在SWaT基准上,对11种检测器采用三种污染策略(随机注入、相似性目标注入、特征噪声注入)进行测试,污染预算为1%至10%。结果显示,鲁棒性高度依赖模型,注入式污染影响最大,局部密度和距离检测器退化严重,而PCA、SVM等相对稳定。

    意义:提醒开发者训练数据可能被污染,影响异常检测模型可靠性;评估不同检测器的鲁棒性,为选择安全关键的ICS检测方案提供参考。

  • 论文公开站arXiv

    ConvergeFlow:具有可证明收敛到词元嵌入的语言流模型

    ConvergeFlow: Language Flow with Provable Convergence to Token Embeddings

    ConvergeFlow是一种基于嵌入空间的流式语言模型,将数据预测器限制在词元嵌入的凸包内,并仅使用流匹配的均方误差目标进行训练。在适当正则条件下,证明该流能收敛到有效词元嵌入,无需交叉熵解码器即可直接预测词元。实验表明其在OpenWebText上性能与现有连续和离散扩散模型相当。

    意义:该研究简化了连续语言模型的训练流程,无需交叉熵解码器,为流式语言建模提供了理论基础,可能提升生成效率与可控性。

  • 论文公开站arXiv

    Prime Agent:一种自我改进的递归语言模型工具链

    Prime Agent: A Self-Improving RLM Harness

    Prime Agent是一个开源工具链,用于长时程评估和编码智能体工作流。它采用递归语言模型抽象,通过持久化IPython REPL进行程序化上下文处理,并持续保存历史、记忆、技能和子智能体配置。递归子智能体可直接通信,人类可通过代理视图监控会话。该工具标准化执行、恢复、验证和资源核算,将策略构建留给模型,防止工具链故障影响模型表现。在ARC-AGI-3上,其RHAE Best@1从30%提升至95.5%,并在多项任务上达到或超过其他主…

    意义:提供标准化工具链,减少环境故障干扰,提升模型真实能力评估,对长时程智能体开发具有参考价值。

  • 广告有人物联网4G插卡工业路由器 多网口无线路由器通5网口路由器 品牌LTE…有券新款样本,适合对照券后价与上架节奏再决定是否入手。京东¥408.57 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    基于物理约束深度学习的非接触式三轴体震信号血压监测模型

    Physics-Constrained Deep Learning Model for Contactless Blood Pressure Monitoring from Triaxial Bodyseismography

    本文提出Phy-BP框架,用于基于三轴体震信号(BSG)的非接触式血压监测。该框架包含自适应质量控制算法,筛选富含心源性成分的BSG段,并建立物理模型描述体-床系统中的三维波传播,嵌入深度学习模型以对齐多轴特征。在21名受试者162小时医院数据集上,Phy-BP能动态过滤低质量测量,并通过物理一致性约束提升模型鲁棒性,尤其在训练样本有限时表现良好。

    意义:该研究将物理模型与深度学习结合,提升非接触式血压监测的鲁棒性和泛化能力,对可穿戴健康监测和AI医疗应用具有重要意义。

  • 论文公开站arXiv

    EG-ARSA:面向低资源场景的视觉道路安全审计开放专家模型

    EG-ARSA: An Expert-Grounded Open Model for Visual Road Safety Auditing in Low-Resource Settings

    该研究提出专家接地蒸馏(EGD)框架,将机构道路安全专业知识迁移至紧凑视觉语言模型,用于可扩展的视觉道路安全审计。通过量化校准阶段,教师模型与权威实地审计达成显著一致(Cohen's kappa=0.74)。蒸馏后的80亿参数学生模型采用低秩适应。研究还发布了首个开放专家接地的孟加拉道路安全审计数据集BD-ARSA,含21,947条图像审计记录,以及首个专为此任务开发的视觉语言模型EG-ARSA。实验显示,接地微调显著提升了序数风险评估…

    意义:为低资源环境提供可扩展的视觉道路安全审计方案,通过专家接地蒸馏提升模型可靠性,对AI在公共安全领域的落地具有示范意义。

  • 论文公开站arXiv

    SWE Refactor Bench:编码代理能否完成长周期、全仓库的代码栈迁移?

    SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?

    SWE Refactor Bench 是一个包含20个全仓库迁移任务的基准,覆盖4种技术债务。三阶段评估协议(迁移审计、行为测试、代理验证)分别验证迁移完成度和行为正确性。在520次运行中,仅28次(5.4%)通过全部阶段,13个任务无接受方案,最佳模型得分47.0/100。摘要显示,代理常因跳过迁移或破坏行为而失败,无法实现完美迁移。

    意义:该基准首次区分迁移完成度与行为正确性,防止代理通过复制原实现作弊,为评估编码代理在长期迁移任务中的真实能力提供新标准。

  • 论文公开站arXiv

    ReWorld:具备长时记忆的交互式世界模型

    ReWorld: An Interactive World Model with Long-Horizon Memory

    摘要显示,ReWorld是一种交互式世界模型,通过混合注意力窗口和随机头路由,在训练时分离控制与记忆,推理时使用有界KV缓存和姿态索引地标库,实现长时记忆下的实时视频生成。数据引擎统一多源数据尺度,并通过LoRA蒸馏实现四步采样,在704x1280分辨率下实时生成,在动作跟随、长时记忆和视频质量方面优于六种现有模型。

    意义:ReWorld解决了交互式世界模型中控制与记忆的结构性矛盾,实现了长时记忆下的实时高保真视频生成,对虚拟现实、游戏和机器人仿真等应用具有重要意义。

  • 广告华为(HUAWEI)凌霄Q7子母路由器WiFi7+千兆电力线版PLC组网…京东新款样本,适合先看规格与上架节奏再决定是否入手。京东¥1219 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    BPCO:一种稳定高效的评论家训练方法

    How to Train a Critic Stably and Efficiently

    摘要显示,基于组的强化学习方法(如GRPO)通过采样多个响应避免训练评论家,但标准评论家训练常不稳定。研究者提出BPCO配方,结合DPPO、奖励范围限定的值预测、蒙特卡洛值目标、未归一化策略优势及长度自适应GAE,并可在训练时向评论家提供奖励定义信息。在数学推理任务中,BPCO一致提升强评论家基线,并匹配或超越组基线,同时每个提示仅采样一个响应。

    意义:为LLM强化学习提供稳定高效的评论家训练方案,减少采样成本,提升训练可靠性,对在线RL算法设计有重要参考价值。