2026年9月23日
当日情报归档 · 时间倒序
共 133 条 · 论文 30 · 资讯 103
- 资讯公开站CNX Software
联发科天玑 CX C10 Max 八核 Cortex-X925/X9/A720 SoC 瞄准 Googlebook
MediaTek Dimensity CX C10 Max octa-core Cortex-X925/X9/A720 SoC targets Googlebooks
摘要显示,联发科 Dimensity CX C10 Max 采用 3nm 工艺与「全大核」八核 Armv9 CPU 架构,搭载 11 核 Immortalis-G925 MC11 GPU 和算力最高 55 TOPS 的 890 NPU,面向一款「即将推出的高端超便携 Googlebook 设备」,主打全天续航。Googlebook 是谷歌新的高端笔记本品类,围绕 Gemini Intelligence 构建,运行代号 Aluminium…
意义:联发科切入 Googlebook 高端笔记本平台,意味着 Arm 阵营在 PC 端再添竞争者,端侧 AI 算力与 Gemini 生态整合值得开发者关注。
- 资讯公开站ScienceDaily Matter & Energy
LHC 刚刚排除了量子黑洞的又一个藏身之处
The LHC just ruled out another hiding place for quantum black holes
摘要显示,物理学家在大型强子对撞机(LHC)数据中未发现其产生微观量子黑洞的证据,但该结果显著缩小了这类奇异物理可能存在的范围。理论上,若额外空间维度使引力在极小尺度上大幅增强,此类黑洞便可能形成,从而为量子引力理论提供线索。
意义:对撞机负结果持续压缩量子引力与额外维度模型的参数空间,为相关理论研究和未来实验设计提供约束依据。
- 论文公开站arXiv
基于 β 积分局部深度与自适应分组的自动深度局部中心聚类
Automatic depth-based local center clustering via $β$-integrated local depth and adaptive grouping
摘要显示,该研究提出全数据驱动的自动深度局部中心聚类方法 A-DLCC,无需用户指定簇数或邻域大小等数值参数。方法利用 β-积分局部深度识别在多个局部层级上持续居中的稳定样本点作为局部中心,并按代表性排序;每个局部中心诱导一个相似点群,群体相似度由所提出的非参数群级局部相似性度量。合并过程借鉴图论瓶颈路径思想,设计单一凝聚规则,自动估计簇数并决定何时停止合并。合成与真实数据实验显示其可产生可解释的聚类结果且无需调参。
意义:免调参的自动聚类对无监督学习与数据分析流程有实用价值,可降低模型选择成本。
- 论文公开站arXiv
基于 LLM 的代码漏洞修复中的指标失效:实证研究与变更感知筛选
Metrics Failure in LLM-Based Code Vulnerability Repair: An Empirical Study and a Change-Aware Screen
摘要显示,作者通过五项对照实验(203个Big-Vul漏洞函数、三个开源代码LLM、三种提示策略)论证编译率在单函数漏洞修复评估中不可靠:约64%的编译失败与模型无关,同一补丁在单个编译器标准标志下编译率波动1.8至2.7倍,且与参考相似度指标给出的模型排序相反;作为优化目标还会奖励删除与占位符式非修复。整函数CodeBLEU同样失效,连未修改的漏洞输入也得分高于所有模型。作者另考察仅对编辑区域打分的diff_F1变更感知筛选方法。
意义:提醒开发者与研究者:以编译率或整函数相似度衡量LLM漏洞修复会得出误导性结论,评估应关注实际修改区域。
- 论文公开站arXiv
EquivSVA:跨等价 RTL 实现的行为断言形式化验证数据集
EquivSVA: A Formally Verified Dataset of Behavioral Assertions Across Equivalent RTL Implementations
摘要显示,EquivSVA 是一个围绕行为族组织的形式化验证数据集,每个族包含同一外部可观察行为的四个结构不同 RTL 实现、共享接口级金标准属性、三个受控变异体及形式验证证据。数据集涵盖 12 个类别、120 个行为族、480 个参考 RTL 实现、914 个金标准属性和 360 个变异体,每个族均通过固定 17 项验证套件,并提供了族安全的训练、开发与测试划分。
意义:为 LLM 生成 SystemVerilog 断言提供行为级评测基准,可检验断言是否捕捉外部可观察行为而非实现细节,推动形式化验证与代码生成研究。
- 资讯公开站rss_robot_report
IAC在拉古纳塞卡完成自动驾驶赛车赛事
IAC completes autonomous racing event at Laguna Seca
- 资讯公开站rss_bbc_business
航空公司批评空中交通管制,第二次故障造成更多中断
Airlines criticise air traffic control as second glitch causes more disruption
- 资讯公开站rss_bbc_business
美国主要机场因施工人员切断电缆导致航班延误
Flights at major US airports delayed after cable cut by construction workers
- 资讯公开站rss_bbc_business
空管系统屡次失灵,我们正陷入令人担忧的境地
Repeated air traffic control failures leave us in worrying territory
- 资讯公开站rss_bbc_business
派拉蒙与美国多州达成诉讼和解,为1100亿美元与华纳兄弟合并扫清障碍
Paramount settles lawsuit with US states, clearing way for $110bn merger with Warner Bros
- 资讯公开站rss_bbc_business
我宁愿花几千块去度假:认识那些花掉子女遗产的退休老人
I'd rather pay thousands on a holiday: Meet the pensioners spending the kids' inheritance
- 资讯公开站rss_bbc_business
兽医处方费在新规下被设上限
Vet prescription fees capped under rule changes
作为规则更新的一部分,兽医还必须告知客户网上是否有更便宜的药品。相关诊所将在未来几个月内落实这些规定。
- 资讯公开站google_news_tsmc
台积电2030年High-NA EUV押注的关键不在机器,而在掩膜
TSMC's 2030 High-NA EUV Bet Isn't About the Machine — It's About the Mask - finance.biggo.com
- 论文公开站arXiv
利用单一传感单元测量历史进行非定常流中的水下导航
Underwater Navigation in Unsteady Flows Using Measurement Histories from a Single Sensing Unit
摘要显示,研究提出一种因果观测器,仅凭单一传感单元的历史测量估计侧向流速,为固定导航控制器提供输入。在二维尾流仿真中,该虚拟传感接口将同步流场采样点从三个减少到机器人中心。仅在 Re=100 圆柱尾流上训练,未重新训练即在 Re=205 和 240 上分别达到 84.4% 和 80.6% 成功率,低于直接空间感知 7.4 和 4.6 个百分点,但显著优于仅当前流速观测器。
意义:为水下机器人减少传感器数量、降低布局约束提供思路,并验证单点流场历史在闭环控制中的可用性。
- 论文公开站arXiv
FleXray:通用临床X射线分割
FleXray: Universal Clinical X-ray Segmentation
摘要显示,X光因三维解剖被压缩为二维投影、结构重叠且边界模糊,导致通用分割标注数据难以构建。作者提出FleXray,利用已有3D全身CT分割数据集与生成式图像编辑模型构建基于物理的生成式X光数据引擎,合成带完整标注的二维X光。模型在未见研究数据集与真实临床X光上可分割60种解剖结构,并支持疾病分级测量、X光引导介入导航与病理目标的数据高效学习。
意义:为X光提供通用全身分割能力,降低对人工标注的依赖,可推动医学影像定量分析与AI辅助介入应用。
- 论文公开站arXiv
类型安全不等于无错误:约束决策头遵循选项名而非绑定规则
Type-Safe Is Not Error-Free: A Constrained Decision Head Follows the Option Name, Not the Rubric Bound to It
摘要显示,该研究考察了Jev及两个类似的开源权重模型在仅改变选项名称与评分标准对应关系时的表现。在1200个工作流决策中,将选项从0/1重命名为no/yes后,每百次回答多出70.4次变化,AUC从0.94降至0.23,表明决策排序出现系统性反转。该效应在全部4个谓词上均成立,且随选项数量增加而增强,并受读出几何影响。
意义:提醒开发者:类型安全的结构化输出并不保证模型正确理解选项语义,选项命名可能显著影响决策可靠性。
- 论文公开站arXiv
扩展执行框架而非上下文:从无策略脚手架到可复用专家智能体
Grow the Harness, Not the Context: From Strategy-Free Scaffolds to Reusable Specialist Agents
摘要显示,该研究提出 Growing Harness 训练范式,从仅暴露固定模型与工具接口、不含任务求解控制器的无策略脚手架出发,利用函数级执行轨迹将失败定位到有限代码范围,由优化器联合修复一组失败,并以成功优先的留出集门控回滚有害修改,使控制结构从任务反馈中逐步涌现。在 BrowseComp-Plus 与 WebArena-Verified 及 4B 至 120B 三种模型上,六种设置中五种平均成功率最高,第六种落后最优 0.7 个百…
意义:该工作把智能体控制逻辑沉淀为可复用代码而非反复填充上下文,显著降低调用次数与推理成本,并为小模型补齐长程任务能力提供新思路。
- 论文公开站arXiv
A2M:MCP生态中基于轨迹优化的智能体劫持
A2M: Trace-Optimized Agent Hijacking in the MCP Ecosystem
摘要显示,使用MCP协议的智能体依赖语义匹配从第三方服务器选择工具,攻击者可通过控制元数据与输出实施语义供应链攻击。作者提出A2M两阶段黑盒框架:Attraction阶段优化工具元数据以提高调用概率,Manipulation阶段利用执行轨迹精炼对抗性工具返回,引导智能体产生攻击者期望结果。在LiveMCPBench上,针对GLM-4.6优化的直接攻击在四个场景中恶意工具调用率达93.6%,认知拒绝服务下加权token成本升至基线32.4…
意义:揭示MCP工具选择机制的供应链风险,提醒开发者在工具审核与运行时隔离上加强防护。
- 论文公开站arXiv
TM-APR:基于解析在线自适应的热成像时序记忆定位
TM-APR: Thermal Temporal-Memory Localization via Analytic Online Adaptation
摘要显示,该工作针对热成像视觉位置识别(Thermal VPR)在在线部署中面临的环境依赖强、在线重训练开销大、难以建模非线性漂移等问题,首次将解析类增量学习(ACIL)与域不变VPR结合,发现其无梯度矩阵更新可构成强基线,并进一步利用ACIL与现代控制理论的代数等价性,将无迹传播、高斯混合划分与极小极大H∞优化嵌入更新回路,实现O(1)复杂度的闭式矩阵更新,使在线学习延迟低于传感器采样间隔,从而避免实时SLAM轨迹跳变。
意义:为热成像SLAM/VPR在线部署提供免反向传播、低延迟的域自适应更新思路,对实时机器人与边缘AI有参考价值。
- 论文公开站arXiv
SWE-Serve:面向生产推理服务的智能体工程基准
SWE-Serve: Benchmarking Agentic Engineering For Production Inference Serving
摘要显示,SWE-Serve 是一个评估智能体完成生产级推理工程任务的基准,包含 53 个源自 SGLang 近期生产变更的仓库级任务,覆盖六大推理工程类别,任务在 CPU 或单张 H100 上执行,采用隐藏功能与回归测试、E2E 服务测试及性能门槛评估。在 11 个模型、31 种配置中,最佳配置平均 pass@1 为 75%,但在 19 个端到端任务中,约三分之一通过局部测试的补丁被服务级 E2E 测试拒绝,暴露出局部完成与生产正确性…
意义:该基准首次系统衡量智能体在生产推理服务中的端到端正确性,揭示局部通过率与真实部署要求之间的落差,为 AI 编码智能体的评估与改进提供更贴近生产的标尺。
- 论文公开站arXiv
CliffCompaction:面向长时程编码智能体的低成本压缩
CliffCompaction: Cost-Efficient Compaction for Long-Horizon Coding Agents
摘要显示,CliffCompaction 是一种自动压缩技术,在有限上下文窗口下可将成本降低最多 50%,同时在 Terminal-Bench 上保持或提升性能,并在 KernelBench 上取得领先结果。其核心在于压缩时只截断或丢弃内容,绝不改写重述,且每轮压缩只处理原始内容、丢弃旧压缩产物,以避免上下文漂移。摘要称其在 KernelBench 上 200 步后实现 2.23 倍、400 步后 3.58 倍的 CUDA 内核加速。
意义:为长周期编程智能体提供低成本上下文管理方案,使测试时扩展更经济,并开源 API 代理实现,便于开发者集成。
- 论文公开站arXiv
SpeakerMem-R1:面向多方对话的以说话人为中心双轨记忆
SpeakerMem-R1: Speaker-Centered Dual-Track Memory for Multi-Party Dialogue
摘要显示,多方对话中的长期记忆需区分「谁说了什么」、涉及对象、个体认知、群体共享信息及状态随时间的变化。现有通用 LLM 记忆系统易丢失人物与群体关系,难以整合分散于成员、群体与时间中的线索。作者提出 SpeakerMem-R1,采用双轨记忆存储带说话人标注的原文消息与派生状态,并分人物级、群体级视图,查询时按实体、事件、时间融合两轨证据;同时用 SpeakerLevenshtein 与说话人条件化 GRPO 训练 Writer-R1 …
意义:为多智能体与多方对话场景的长期记忆提供可归因、可本地部署的结构化方案,缓解人物关系丢失与状态重建难题。
- 论文公开站arXiv
一种带延迟信息共享的分散式部分可观测团队决策方法
A Decentralized Partially Observable Team Decision Methodology with Delayed Information Sharing
摘要显示,该研究针对具有低秩隐动态且系统模型未知的去中心化部分可观测团队决策问题,提出结合团队理论等价性与低秩模型表示的框架。团队成员仅依据本地私有信息与延迟共享的公共信息,各自学习近似低秩马尔可夫决策过程,并用最小二乘值迭代求解策略,无需集中式协调者或集中训练。文中证明成员侧解可逼近集中式团队最优策略,并给出有限样本性能保证与样本复杂度界。
意义:为多智能体在通信受限、模型未知场景下提供去中心化学习与规划的理论保证,对分布式强化学习与协作决策系统有参考价值。
- 论文公开站arXiv
DreamStream:面向端到端驾驶的策略导向生成式仿真
DreamStream: Towards Policy-Oriented Generative Simulation for End-to-End Driving
摘要显示,现有仿真平台存在仿真到真实的视觉差距,会破坏策略感知,难以评估端到端驾驶策略的闭环决策。作者提出 DreamStream,一种基于仿真器接地的自回归视频模型构建的生成式闭环仿真器,通过交通布局引导从大型预训练视频模型蒸馏,在改变视觉外观的同时保留场景布局与动态物体时序一致性等策略相关特征。作者还指出 FID 等感知指标会误判特征保留程度,并提出多表示指标 FDπ。摘要称,在 FDπ 下 DreamStream 相比最强先前闭环…
意义:为端到端自动驾驶提供更贴近策略感知的闭环仿真与评测指标,有望降低真实路测成本并暴露策略失效场景。
- 论文公开站arXiv
φ-RIE:从逼真重建到可交互环境
φ-RIE: From Photorealistic Reconstruction to Interactive Environments
摘要显示,3D高斯泼溅(3DGS)虽能对捕获场景实现照片级真实重建,但该表示本身不支持物理交互,因为物体外观可能与背景纠缠,且被遮挡的物体几何与背景内容未被观测。为此作者提出φ-RIE,一种高斯原生流水线,将选定物体转换为可移动的模拟器资产,同时保留其余重建内容,其核心是资产构建与源移除相耦合。在50个ScanNet++场景上,基于证据的选择与配准重试将20毫米匹配F1从0.336提升至0.383。
意义:为机器人仿真与具身智能提供从真实场景重建到可交互资产的转换路径,弥合视觉重建与物理仿真之间的鸿沟。