- 论文公开站arXiv
Deep Learning for Sleep Heart Rate Estimation from Accelerometers: Toward Population-Scale Cardiac Insight Without Optic
Large longitudinal cohorts often contain wrist accelerometry without optical heart-rate sensing, motivating recovery of cardiac information from motion signals already collected during sleep. We present SeqSmoother, a tr…
- 论文公开站arXiv
Learning to Read the Contextual Tokens in Diffusion Transformers
Multimodal Diffusion Transformers (MM-DiTs) jointly process visual and textual representations throughout generation. These models repeatedly update the text tokens through multimodal attention, forming dynamic contextua…
- 资讯公开站Digitimes
Behind the US$4.2 trillion revenue gap in AI infrastructure
AI data center plans and computing demand are expanding far faster than physical infrastructure can be built, creating a widening gap between planned and actually deployed compute. A review tracking construction progress…
- 论文公开站arXiv
Less Decoder is More Encoder: Geometric Representation Learning from Novel View Synthesis
This paper examines the role of Novel View Synthesis (NVS) in geometric representation learning. In principle, NVS should reason about 3D scene structure, thereby enabling transferable multi-view geometric representation…
- 资讯公开站Digitimes
LG Electronics, LS Electric target AI data center bottlenecks with US cooling capacity, 345kV power deals
South Korea's LG Electronics and LS Electric are expanding deeper into AI data center infrastructure, targeting two of the fastest-growing bottlenecks around high-density computing: cooling and power delivery. LG is addi…
- 论文公开站arXiv
Embedding Prediction Helps Image Generation
In diffusion transformers, a class label or a text prompt is embedded once, and the same condition is reused at every denoising step. We ask whether predicted embeddings can serve as this condition instead. Next-Embeddin…
- 资讯公开站Power Electronics News
Power Corner: Why Solid-State Transformers Are Key to Scaling AI Data Centers
- 论文公开站arXiv
Scaling Laws for Looped Mixture of Experts
Looped transformers and Mixture-of-Experts (MoE) offer complementary routes to efficient scaling: recurrence increases computational depth at fixed parameters, while MoE sparsity expands total capacity at fixed active co…
- 论文公开站arXiv
图像分类器是高效的自监督视频表征学习器
Image Classifiers are Efficient Self-Supervised Video Representation Learners
提出 VideoMSN,一种用于视频高效自监督时空表征学习的掩码孪生网络框架。它不依赖重型3D架构或重建式自编码器,而是复用标准图像分类器处理无标注数据。
- 论文公开站arXiv
农田模式:并行维度注意力网络与数据集差异注意力用于作物分割
Cropland PAtteRNS: Parallel Dimensional Attention Networks and Attention to Dataset Disparity for Crop Segmentation in Satellite Imagery Time Series Data
卫星影像时间序列数据集和作物分割架构日益丰富,但在追求最新概念或最大数据集的过程中,两方面的重要事实被忽视。本文提出并行维度注意力网络及数据集差异注意力方法。
- 论文公开站arXiv
照搬相同,蒸馏差异:线性视觉Transformer的初始化
Copy the Same, Distill the Difference: Initializing Linear Vision Transformers
线性视觉Transformer(ViT)旨在用线性复杂度注意力算子替代Softmax ViT中的注意力,以实现更高效的token路由,但需要从头预训练,且通常性能不及原版Softmax。如何初始化是关键。
- 论文公开站arXiv
用自适应循环Transformer改进测试时扩展
Improving Test-Time Scaling with Adaptive Looped Transformers
循环Transformer通过复用层进行潜在计算,展现出良好的参数效率。此前研究在参数量或每token FLOPs匹配下比较循环与非循环模型,但循环是否改善测试时扩展尚不明确。
- 论文公开站arXiv
如何循环MoE:展平专家,解绑注意力
How to Loop MoE: Flatten the Experts, Untie the Attention
循环Transformer多次复用同一层块:通过额外计算让固定规模模型走得更远,更充分利用参数;而稀疏混合专家(MoE)模型每个token只激活少数专家。循环MoE将两者结合。
- 论文公开站arXiv
神经调和测度算子
Neural Harmonic Measure Operator
我们提出神经调和测度算子(NHMO),一种用于变形状区域上椭圆偏微分方程问题的神经求解器。区域的调和测度是一种边界概率分布,与任意边界数据积分后即返回Dirichlet Laplace解。
- 论文公开站arXiv
伸缩式语言模型
Telescopic Language Models
一个已部署的语言模型常需服务多种算力预算,而每个预算点仍需单独训练或压缩;本文训练伸缩式语言模型(TLM)作为连续体,由随机前缀监督的嵌套容量Transformer构成。
- 论文公开站arXiv
ADPTNet:面向序列建模的自适应规定时间尺度非线性 SSM
ADPTNet: Adaptive with Prescriptive Timescales Non-Linear SSM for Sequence Modelling
神经形态计算的核心目标是提供高能耗 Transformer AI 的可行替代方案。然而,高效替代方案难以捕捉使 Transformer 成为序列建模事实标准的一系列特性。
- 论文公开站arXiv
基于状态空间模型的 3D 点跟踪
3D Point Tracking with State Space Models
在度量 3D(绝对米制,而非未知尺度)中跟踪动态场景的任意点,支撑着 3D/4D 重建、机器人导航和自动驾驶——这些场景以米而非像素做决策。我们的目标是构建在此类场景中精确的 3D 点跟踪器。
- 论文公开站arXiv
跳出框框:滑动窗口 KV 推理中的信息保留与传递
Thinking Outside the Box: Retention and Transmission of Information in Sliding-Window KV Inference
滑动窗口 KV 推理指增量处理序列,仅保留固定大小的近期键值状态缓存。它可在推理时应用于预训练因果 Transformer 而无需额外训练,同时其 KV 缓存内存保持固定。
- 资讯公开站Energy Storage News
特朗普以“异常和特殊威胁”为由发布行政令,禁止逆变器、BESS 和变压器进口
Trump cites ‘unusual and extraordinary threat’ in executive order banning inverter, BESS & transformer imports
摘要显示,美国总统特朗普签署行政令,以“异常和特殊威胁”为由禁止进口逆变器、变压器及其他可能对美国电网安全构成风险的电力设备。该禁令涉及电池储能系统(BESS)相关设备,但摘要未披露具体生效时间、受限国家或豁免条款。
意义:若禁令落地,将冲击美国储能与电网设备的供应链,中国逆变器及变压器出口企业需评估合规与市场风险。
- 论文公开站arXiv
信任引导的决策Transformer
Trust Guided Decision Transformer
摘要显示,Decision Transformer 在长程 rollout 中因条件上下文偏离训练分布而性能下降,这种漂移可通过模型自身的下一状态预测误差观察到。作者提出 Trust Guided Decision Transformer(TGDT),先用滚动下一状态预测误差并结合 split conformal prediction 校准阈值筛选可信上下文后缀,再由冻结 critic 在可信后缀中选择最高价值动作。D4RL 导航与运动…
意义:为离线强化学习中的长程决策提供了一种基于模型自检误差的上下文可靠性筛选思路,有助于提升 Decision Transformer 类方法的稳定性。
- 论文公开站arXiv
排斥自注意力的非平衡相:混沌、注意力凝聚与涌现局域性
Nonequilibrium Phases of Repulsive Self-Attention: Chaos, Attention Condensation, and Emergent Locality
摘要研究了一个极简循环 Transformer 的非平衡动力学:N 个归一化 token,Q=K=I,值映射为负 V=-I。相似度注意力选择邻近表示,而负值映射将 token 推离被选场,形成反馈。d=2 时 token 位于圆上,正多边形为精确不动点;随注意力反馈强度 γ 增大,多边形经翻转分岔失稳,出现周期二运动、混沌及簇交换/翻转态。有限 β 下注意力随 N→∞ 仍弥散,凝聚出现在 β~N² 尺度;硬路由极限下出现表示空间的蝴蝶锥…
意义:为理解注意力机制的非平衡动力学提供极简可解析模型,揭示混沌、凝聚与局域化相变,启发对 Transformer 表达与稳定性的理论分析。
- 论文公开站arXiv
FAMOS:从稀疏观测前馈式建模3D铰接物体
FAMOS: Feed-Forward 3D Articulation Modeling from Sparse Observations
摘要显示,FAMOS 是一种前馈模型,可从稀疏、无序的部分点云集合中预测可动部件分割与关节参数,联合推理多个观测并支持可变数量输入(含单视图)。方法引入 Multi-state Articulation Transformer,交替进行状态级与全局注意力,并提出 observed articulation span 目标以监督各部件在输入观测中的运动范围。作者还构建程序化数据生成器合成自标注资产,在 PartNet-Mobility、A…
意义:为机器人操作与具身智能提供无需逐物体优化的稀疏视图铰接物体建模方案,降低对类别级形状先验与密集观测的依赖。
- 论文公开站arXiv
模型增长、递归和边界算子如何影响缩放指数
How Model Growth, Recursion, and Boundary Operators Influence Scaling Exponents
摘要显示,该研究挑战了缩放定律中指数固定的传统认知,指出架构干预可改变预训练缩放指数,从而随算力增加带来指数级性能提升。作者以循环Transformer为锚点,发现模型增长(含是否共享权重)对缩放指数影响最大:7.4B增长架构在CORE上以约20倍更少算力匹配GPT-3 13B,且算力效率增益随规模增大。普通Transformer中加入边界算子也有较小增益;数据受限多轮训练下,循环具正则化效果,且随规模增加循环数为算力最优。
意义:若缩放指数可被架构改变,则算力效率提升会随规模放大,为开发者提供超越单纯堆参数的新扩展路径。
- 论文公开站arXiv
PointZero:用于学习可迁移3D动力学的3D点轨迹补全
PointZero: 3D Point Track Completion for Learning Transferable 3D Dynamics
摘要显示,该研究提出将三维点轨迹补全作为预训练目标,在无需机器人动作标签的情况下学习可迁移的三维动力学先验。给定单次RGB-D观测与稀疏部分三维轨迹,模型预测所有观测点的未来三维轨迹。作者构建了涵盖可变形、铰接与刚性物体的290万帧合成数据集,并训练了基于Transformer的PointZero,在相同数据上优于既有方法;微调后在PGND三维动力学基准及6/7项仿真与真实机器人操作任务上表现优异。
意义:为机器人学习提供无需动作标签的3D动力学预训练范式,可纳入网络视频数据,降低对昂贵机器人数据的依赖。
- 开源项目公开站GitHub
从零开始用PyTorch实现ChatGPT式大语言模型的逐步教程
rasbt/LLMs-from-scratch — Implement a ChatGPT-like LLM in PyTorch from scratch, step by step
该GitHub仓库提供从零开始用PyTorch实现ChatGPT式大语言模型的详细教程。内容涵盖数据准备、模型架构、训练与微调等步骤,旨在帮助开发者深入理解LLM内部机制。仓库已获得超过10万星标,表明其受欢迎程度和实用性。
意义:为开发者提供从零构建LLM的实战指南,有助于深入理解Transformer架构和训练细节,是学习和研究大模型的重要资源。