全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「预训练」共 19 条

  • 论文公开站arXiv

    AssemblyWorld:用通用智能体重思3D装配

    AssemblyWorld: Rethinking 3D Assembly with General-Purpose Agents

    3D装配需将零件及其关系的理解转化为精确空间排布。本文探究预训练通用智能体能否仅通过视觉交互完成物体装配,而无需针对装配任务额外微调。

  • 论文公开站arXiv

    重新思考世界-动作建模的表征

    Rethinking Representations for World-Action Modeling

    世界-动作模型联合学习机器人策略并预测未来观测,使表征空间成为控制与预测的接口。本文通过受控比较研究该空间的设计,发现重建保真度和预训练均非关键。

  • 论文公开站arXiv

    照搬相同,蒸馏差异:线性视觉Transformer的初始化

    Copy the Same, Distill the Difference: Initializing Linear Vision Transformers

    线性视觉Transformer(ViT)旨在用线性复杂度注意力算子替代Softmax ViT中的注意力,以实现更高效的token路由,但需要从头预训练,且通常性能不及原版Softmax。如何初始化是关键。

  • 论文公开站arXiv

    跳出框框:滑动窗口 KV 推理中的信息保留与传递

    Thinking Outside the Box: Retention and Transmission of Information in Sliding-Window KV Inference

    滑动窗口 KV 推理指增量处理序列,仅保留固定大小的近期键值状态缓存。它可在推理时应用于预训练因果 Transformer 而无需额外训练,同时其 KV 缓存内存保持固定。

  • 广告傲天极限BURTON男女款HOVER雪服背带裤FREEBIRD防水GOR…新款·淘宝·市场见相关商品上架/在售信号淘宝¥5298 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    观察、回忆、行动:并发具身流中的常开机器人

    Watch, Recall, Act: Always-On Robots in Concurrent Embodied Streams

    摘要显示,论文针对「永远在线」机器人面临的持续指令流、场景变化与自身历史动作影响问题,提出 ARMS 流式策略:以预训练 π0.5 为骨干,叠加三个轻量模块,将实时感知、具身状态与自身过去动作转为上下文,异步更新使「看」与「忆」不阻塞「行动」,双臂可并发执行。作者构建 ARMS Dataset 以真实双臂遥操作自动标注各模块,联合任务达 45%,强基线为 28%,消融显示记忆模块、具身状态头与异步并发均必要。

    意义:为长时在线、可中断的具身智能体提供简单可扩展的流式上下文方案,异步并发设计对实时机器人系统有直接参考价值。

  • 论文公开站arXiv

    作者验证的对比学习

    Contrastive Learning for Authorship Verification

    摘要显示,在测试设定下对比学习方法在作者身份验证任务上优于基于分类的方法。研究识别出损失函数、批量大小、训练时长、预训练模型、输入上下文长度及随机文本片段数据增强为影响模型性能的关键因素,并据此构建了ModernBERT双编码器模型,在PAN21作者身份验证任务上取得98.4%的准确率。

    意义:为文本作者归属与AI生成内容溯源提供高精度基线,双编码器+对比学习范式可迁移至其他文本匹配任务。

  • 论文公开站arXiv

    高维潜变量的可扩散性

    On the Diffusibility of High-Dimensional Latents

    摘要显示,表征自编码器(RAEs)让扩散模型能在预训练视觉编码器的特征空间中工作,但现成编码器为重建微调后会降低表征的有效维度。作者指出,在这种高维空间中使用流匹配的标准速度预测,会迫使模型拟合低维信号流形之外的正交噪声方向,导致优化低效;因此改用干净数据参数化(x0 预测),让学习聚焦于信号流形。多组强重建编码器实验显示,x0 预测一致提升文生图生成性能。

    意义:为在预训练编码器潜空间上做扩散/流匹配的开发者提供参数化选择依据:x0 预测可能比速度预测更高效、生成质量更好。

  • 论文公开站arXiv

    DreamStream:面向端到端驾驶的策略导向生成式仿真

    DreamStream: Towards Policy-Oriented Generative Simulation for End-to-End Driving

    摘要显示,现有仿真平台存在仿真到真实的视觉差距,会破坏策略感知,难以评估端到端驾驶策略的闭环决策。作者提出 DreamStream,一种基于仿真器接地的自回归视频模型构建的生成式闭环仿真器,通过交通布局引导从大型预训练视频模型蒸馏,在改变视觉外观的同时保留场景布局与动态物体时序一致性等策略相关特征。作者还指出 FID 等感知指标会误判特征保留程度,并提出多表示指标 FDπ。摘要称,在 FDπ 下 DreamStream 相比最强先前闭环…

    意义:为端到端自动驾驶提供更贴近策略感知的闭环仿真与评测指标,有望降低真实路测成本并暴露策略失效场景。

  • 广告傲天极限BURTON伯顿男女款HOVER单板滑雪服雪裤GORE TEX防…新款·淘宝·市场见相关商品上架/在售信号淘宝¥3180 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    BrainWideBench:多区域神经记录的大规模预训练与跨动物迁移基准

    BrainWideBench: Benchmarking large-scale pretraining and across-animal transfer in multi-region neural recordings

    摘要显示,该工作提出 BrainWideBench,用于评估多区域神经记录上的跨动物迁移能力,数据基于国际脑实验室 Brainwide Map,覆盖 139 只小鼠、276 个脑区。基准包含三类任务:行为解码、掩码或未来神经活动预测,以及解剖组织结构的恢复。结果显示预训练优于单会话基线,但迁移收益高度依赖预训练目标与下游任务的对齐程度,没有单一方法在全部任务上普遍最优。

    意义:为神经基础模型提供统一评测协议,提示开发者预训练目标需与下游任务对齐,而非追求通用表征。

  • 论文公开站arXiv

    分布偏移如何影响神经PDE代理模型的预训练收益?

    How Does Distribution Shift Shape Pretraining Gains in Neural PDE Surrogates?

    摘要显示,研究者在254,909个RANS解上预训练神经PDE代理模型,再在具有匹配来流范围的新翼型族上微调,比较相同SA模型与加入e^N转捩建模两种目标设定。结果显示,预训练收益取决于目标数据预算、目标数据覆盖度以及源域与目标域是否在建模物理上存在差异,且随样本量变化收益排序会反转。

    意义:为科学机器学习中预训练代理模型的迁移策略提供量化依据,提示开发者需根据目标数据量与物理差异权衡预训练收益。

  • 论文公开站arXiv

    模型增长、递归和边界算子如何影响缩放指数

    How Model Growth, Recursion, and Boundary Operators Influence Scaling Exponents

    摘要显示,该研究挑战了缩放定律中指数固定的传统认知,指出架构干预可改变预训练缩放指数,从而随算力增加带来指数级性能提升。作者以循环Transformer为锚点,发现模型增长(含是否共享权重)对缩放指数影响最大:7.4B增长架构在CORE上以约20倍更少算力匹配GPT-3 13B,且算力效率增益随规模增大。普通Transformer中加入边界算子也有较小增益;数据受限多轮训练下,循环具正则化效果,且随规模增加循环数为算力最优。

    意义:若缩放指数可被架构改变,则算力效率提升会随规模放大,为开发者提供超越单纯堆参数的新扩展路径。

  • 论文公开站arXiv

    PointZero:用于学习可迁移3D动力学的3D点轨迹补全

    PointZero: 3D Point Track Completion for Learning Transferable 3D Dynamics

    摘要显示,该研究提出将三维点轨迹补全作为预训练目标,在无需机器人动作标签的情况下学习可迁移的三维动力学先验。给定单次RGB-D观测与稀疏部分三维轨迹,模型预测所有观测点的未来三维轨迹。作者构建了涵盖可变形、铰接与刚性物体的290万帧合成数据集,并训练了基于Transformer的PointZero,在相同数据上优于既有方法;微调后在PGND三维动力学基准及6/7项仿真与真实机器人操作任务上表现优异。

    意义:为机器人学习提供无需动作标签的3D动力学预训练范式,可纳入网络视频数据,降低对昂贵机器人数据的依赖。

  • 广告海外直订日语 ウォーカブルシティ入門 10のステップでつくる歩きたくなる…新款·京东·市场见相关商品上架/在售信号京东¥192.8 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    LimiX-2:面向通用结构化数据智能的上下文机制网络

    LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence

    摘要显示,LimiX-2 是 LimiX 家族新模型,依据既有缩放律进行模型与数据扩展,采用上下文机制网络(CMN)范式并以 Context-Conditional Masked Modeling 预训练。CMN 将上下文学习的组织原则从以目标为中心的预测转向机制导向的联合建模,学习 p(x, y | D_context) 而非传统表格 PFN 的 p(y | x, D_context)。预训练数据由结构因果模型生成。在 TabAren…

    意义:为表格/结构化数据提供新的基础模型范式,兼顾预测性能与因果可解释性,对表格 AI 与因果发现方向有参考价值。

  • 论文公开站arXiv

    FreqSpaNet:用于物理层硬件完整性检测的SFPF频率与空间学习

    FreqSpaNet: Frequency and Spatial Learning of SFPF for Physical Layer Hardware Integrity Detection

    摘要显示,未经授权的硬件替换可在保留无线设备逻辑身份的同时改变其物理实现,给硬件完整性验证带来挑战。时空频极化指纹(SFPF)能捕获设备在多个频率与方向上的响应,但其频域与空域维度具有不同的结构依赖关系。为此作者提出 FreqSpaNet,一个用于开集硬件异常检测的 SFPF 表征学习网络:频率分支捕获相邻频率间的局部变化,几何感知空间分支利用角度信息建模方向关系,两者经自适应融合并结合互补预训练。实验显示其平均 AUROC 达 96.…

    意义:为无线设备硬件完整性验证提供频域-空域联合表征方法,对物理层安全与设备身份认证研究有参考价值。

  • 论文公开站arXiv

    有效学习率主导语言模型预训练中的损失动态

    Effective Learning Rate Governs Loss Dynamics in Language Model Pretraining

    摘要显示,在语言模型预训练中发现有效学习率(ELR)坍缩现象:学习率与参数范数主要通过其比值(即有效学习率)影响损失动态。当ELR匹配时,不同运行间的损失轨迹在整个训练过程中坍缩,尽管学习率和参数范数差异显著。跨优化器、架构、数据集和模型规模,平均坍缩误差通常为几乘以10^-3,低于代表性配置中种子间变异。系统消融表明,归一化设计和学习率-范数变化的时间尺度是坍缩精度的关键决定因素。受控干预进一步显示,权重衰减和超球形状主要通过其诱导的…

    意义:为语言模型预训练提供统一的优化视角,有助于改进学习率调度与范数控制策略,提升训练效率与可预测性。

  • 论文公开站arXiv

    LAION-BVD:千万小时级开放视频数据集,助力多模态预训练

    LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training

    LAION-BVD是LAION发布的大规模开放视频数据集,包含从CommonCrawl收集的13亿条平台视频URL,成功下载8000万段视频,总时长1000万小时。该数据集旨在支持视频、音频和图像多模态预训练,通过场景检测提取片段并合成字幕。基于此训练的模型在视频-文本和音频-文本基准上表现优异,且性能随规模提升。此外,提取的场景帧作为图像-文本数据源,展现出与网络图像不同的分布,模型在图像-文本检索上表现强劲。数据集已开源,显著扩大了…

    意义:为多模态预训练提供千万小时级开放视频资源,填补大规模视频数据空白,推动视频、音频、图像联合学习研究。

  • 广告海外直订日语 アレルギー 私たちの体は世界の激変についていけない アレル…新款·京东·市场见相关商品上架/在售信号京东¥204 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    基于适配器的少样本持续学习用于恶意数据包识别

    Adapter-Based Few-Shot Continual Learning for Malicious Packet Recognition

    摘要显示,针对恶意软件变体持续演化,作者提出一种基于适配器的少样本类增量学习框架,用于恶意数据包识别。该方法使用自监督学习骨干网络,并通过领域特定预训练初始化,在基础会话中采用低秩适配(LoRA)微调,同时冻结核心骨干以保留旧知识,增量会话使用原型分类头。实验表明,该方法在多个数据集上优于现有恶意软件FSCIL基线,达到最先进性能。

    意义:该研究为恶意软件检测提供了一种高效的持续学习方案,能适应新威胁而不遗忘旧知识,对网络安全领域的AI模型部署具有实用价值。

  • 论文公开站arXiv

    PerturbRx:学习治疗条件下的潜在状态转换以预测患者药物反应

    PerturbRx: Learning Treatment-Conditioned Latent Transitions for Patient Drug Response Prediction

    摘要显示,PerturbRx是一个治疗条件下的表示学习框架,用于预测患者级别的癌症治疗反应。它从上下文匹配但细胞未配对的对照和处理的单细胞群体中训练药物和剂量条件的转换预测器,然后冻结并迁移到预处理患者概况,无需治疗后测量。在TCGA和患者来源异种移植基准上,PerturbRx取得了最强的综合预测性能。

    意义:该框架利用扰动预训练的潜在转换作为特征,无需治疗后数据即可预测反应,为精准肿瘤学中的药物反应预测提供了新思路。

  • 论文公开站arXiv

    可解释的Transformer模型用于结构化电子健康记录上的临床预测任务

    Explainable Transformer Models for Clinical Prediction Tasks on Structured Electronic Health Records

    摘要显示,研究者提出BERT-LER模型,一种基于BERT架构的模型,用于编码电子健康记录(EHR)时间线。该模型在包含7500万患者的去标识化EHR数据集上预训练和微调,将实验室检测结果编码为离散令牌,并通过基于百分位的分箱保留分级信息,结合集成梯度方法提供令牌级归因。在EHRShot基准和哮喘严重程度进展研究中,BERT-LER在预测性能上与公开基准模型竞争,在实验室相关任务上常超越它们,且归因与临床已知风险因素一致。

    意义:该研究将实验室值表示与可解释性统一于一个框架,为EHR基础模型提供方法论补充,有助于临床预测的可靠性和临床采纳。