- 资讯公开站Digitimes
Google skips Gemini 3.5 Pro, launches Gemini 4 Argon at US$2/$10 per million tokens
Google has unveiled Gemini 4 Argon, its new top-tier AI model, after months of delays and the cancellation of Gemini 3.5 Pro, launching it at introductory prices of US$2 per million input tokens and US$10 per million out…
- 资讯公开站Digitimes
MediaTek TPU orders rise as chip capacity war intensifies
MediaTek's Google Tensor Processing Unit (TPU) business is still moving steadily higher, but supply-chain sources say the real limit is capacity as chipmakers and cloud service providers (CSPs) battle for semiconductor o…
- 论文公开站arXiv
Cogentic:面向自动证明发现的多智能体编排
Cogentic: Multi-Agent Orchestration for Automated Proof Discovery
提出 Cogentic,一个用于开放研究问题自动证明发现的多智能体框架。前沿语言模型虽能单次生成优质数学想法,但面对需多路径探索的开放问题,单次生成往往不足。
- 论文公开站arXiv
DP-SGD 下权重绑定对纯解码器 LLM 是否仍有益?
Is Weight Tying Still Beneficial for Decoder-Only LLMs in Private Settings Under DP-SGD?
DP-SGD 是大模型隐私保护微调的主流方法。许多纯解码器 LLM 采用输入输出嵌入权重绑定,本文在差分隐私设定下重新审视这一设计是否仍然有利。
- 资讯公开站CNX Software
面向 CM5 的 30 美元树莓派智能显示模块,瞄准数字标牌与自助终端
$30 Raspberry Pi Smart Display Module for CM5 targets digital signage displays and kiosks
树莓派智能显示模块是兼容英特尔智能显示模块(SDM)规范的 CM5 载板,具体为 SDM-L 规格。英特尔 SDM 标准已存在多年。
- 资讯公开站Digitimes
谷歌将首次把TPU送入轨道,测试太空AI计算
Google to test AI computing in space with first orbital TPU launch
谷歌准备首次将其自研AI加速器TPU送入近地轨道,探索AI计算能否从地面数据中心扩展到太空。CEO皮查伊近日宣布了这一计划。
- 资讯公开站Digitimes
2027年ASIC出货量超越GPU,ABF载板瓶颈转移
ASIC shipments top GPUs in 2027 as ABF substrate bottlenecks shift
2027年高端云AI加速器市场将发生结构性转变,ASIC总出货量首次超过GPU,受谷歌、亚马逊和华为产量上升推动,市场进入英伟达与ASIC双雄竞争格局。
- 资讯公开站rss_arxiv_cs_ai
更多程序还是更多重复?区分LLM执行框架中的覆盖度与专业化
More Programs or More Rolls? Separating Coverage from Specialization in LLM Harnesses
arXiv:2609.35873v1 公告类型:新 摘要:LLM执行框架的自动生成有望通过任务专业化提升推理能力。然而,额外的答案覆盖度也可能来自同一程序的重复执行,这使得专业化难以识别。我们引入一种受控评估,将答案覆盖度、可重复的任务优势以及执行前选择带来的增益区分开来。在386个MATH-500任务上,我们比较了八个生成的执行框架以及一个基线及其九个字节完全相同的副本,每个成员执行三次。相同程序产生了2.16个百分点的重复平均ora…
- 论文公开站arXiv
大模型图重建失真的谱理论:紧界与实证刻画
A Spectral Theory of Distortion in LLM Graph Reconstruction: Sharp Bounds and Empirical Characterization
语言模型图重建评估通常报告原始图与重建图之间的单一聚合距离。本文证明对于拉普拉斯谱间的Wasserstein距离,该汇总受两个边计数约束。
- 论文公开站arXiv
LeapQuant:具有精确循环状态量化的高效线性注意力
LeapQuant: Efficient Linear Attention with Accurate Recurrent State Quantization
近期大模型越来越多采用线性注意力替代标准注意力,如Gated DeltaNet和Kimi Delta Attention。这些方法将上下文压缩为固定大小循环状态,大幅降低长上下文成本。本文提出LeapQuant。
- 论文公开站arXiv
STEPQuant:Delta规则循环状态量化中误差何时何地重要
STEPQuant: When and Where Errors Matter in Delta-Rule Recurrent State Quantization
线性注意力用固定大小循环状态替代增长的KV缓存,但这些持久状态在并发服务下可能成为内存瓶颈。直接低精度量化循环状态常导致严重精度下降。本文提出STEPQuant。
- 论文公开站arXiv
用自适应循环Transformer改进测试时扩展
Improving Test-Time Scaling with Adaptive Looped Transformers
循环Transformer通过复用层进行潜在计算,展现出良好的参数效率。此前研究在参数量或每token FLOPs匹配下比较循环与非循环模型,但循环是否改善测试时扩展尚不明确。
- 资讯公开站rss_arxiv_cs_ai
通过嵌入式编码改进大语言模型的医学计算能力
Improving Medical Calculation of LLMs with Embedded Coding
arXiv:2609.31908v1 公告类型:新 摘要:大语言模型(LLM)在医学考试和问答基准上表现良好,但在需要精确数值输出的医学计算任务上仍不可靠。这些计算支撑着用药剂量、器官功能评估和预后评分等高风险决策,即使很小的误差也可能带来严重的临床后果。我们提出 MedCode,一个通过训练 LLM 生成嵌入式可执行代码来改进医学计算的框架。给定临床情境,模型识别相关计算器,提取其输入变量,并生成一段将算术运算委托给确定性解释器的脚本…
- 资讯公开站rss_arxiv_cs_ai
Benchy:迈向面向任务型AI基准测试的通用语言
Benchy: towards a universal language for task-oriented AI benchmarks
arXiv:2609.30550v1 公告类型:新 摘要:Benchy 是一种用于对 AI 程序进行基准测试的语义语言与执行引擎。一个基准由程序、评分函数和数据集完整指定,B=(P,S,D),并与接受测试的 AI 系统相分离;一次运行将二者绑定,R=(B,AI)。基准以规范 YAML 编写,其中每个语义概念只有一种有效语法,并由共享的任务/领域/语言本体分类,且被确定性地编译为规范 JSON 中间表示,由引擎执行。编译改变的是表示,而非…
- 资讯公开站rss_pv_magazine
通威推出TNC 2.0 FULLX G12R-48屋顶太阳能组件,效率达24.5%
Tongwei launches TNC 2.0 FULLX G12R-48 rooftop solar module with 24.5% efficiency
- 论文公开站arXiv
后验机制与潜在欺骗:隐马尔可夫模型中的变分贝叶斯推断用于序列欺诈检测
Posterior Regimes and Latent Deception: Variational Bayesian Inference in Hidden Markov Models for Sequential Fraud Detection in Financial Transactions
我们提出隐马尔可夫模型的三层递进:最大似然(Baum-Welch)、变分贝叶斯(VBEM)及神经变分扩展(Neural VBEM),将每位客户的交易历史建模为少数潜在行为状态的轨迹。
- 论文公开站arXiv
Kafila:在可信异构消费级机器集合上服务大语言模型
Kafila: Serving Large Language Models on a Trusted Set of Heterogeneous Commodity Machines
研究组成员或朋友圈各自拥有几台消费级计算机,但单台都不足以运行一个有能力的大语言模型。现有系统在开放集群中汇聚此类算力,而仅接纳可信机器的群体则无法使用。
- 资讯公开站Digitimes
AI需求推动台湾PCB产值创新高,全年有望破万亿新台币
Taiwan PCB output hits record high on AI demand, putting NT$1 trillion year within reach
2026年第二季度,AI服务器、高速网络与内存需求持续拉动台湾PCB产业,带动载板、高层数板与HDI产品需求,先进材料供应紧张与原材料涨价也推高价格。
- 资讯公开站Energy Storage News
澳大利亚:Akaysha Energy的Waratah超级电池测试满额SIPS义务,输出达850MW
Australia: Akaysha Energy’s Waratah Super Battery tests full SIPS obligation as 850MW output recorded
- 论文公开站arXiv
直接反馈对齐中的共模坍缩与恢复
Common-Mode Collapse and Recovery in Direct Feedback Alignment
摘要显示,直接反馈对齐(DFA)用固定随机投影回传输出误差训练隐藏层,在 tanh 隐单元与独立 sigmoid 输出下,普通 SGD 可能停滞在接近类别频率常数预测器的损失水平。作者将停滞归因于误差中的共模成分,通过精确的均值-协方差分解分离出由均值教学信号和均值突触前活动构成的秩一更新,其主成分推动 tanh 单元饱和。校准读出基线可抑制坍缩并加速学习。
意义:揭示固定随机反馈训练不稳定的共模机制,为对齐类算法与无反向传播训练的优化设计提供改进思路。
- 论文公开站arXiv
新的LoRA技能应只读不写
New LoRA Skills Should Read but Never Write
摘要显示,该论文针对多个独立训练的LoRA适配器难以合并的问题,指出权重空间合并会相互干扰、全量重训成本高、路由方案又失去单一模型的意义。作者提出READ方法,将每个适配器重写为保持更新等价的平衡规范形式,并让新旧技能耦合单向生长:新技能可读取旧技能输入子空间但不能写入其输出子空间,每次追加仅训练耦合矩阵中新技能对应的一行,组合更新可折叠进基础权重,无推理成本与路由。
意义:为多任务LoRA合并提供免路由、零推理开销的持续学习方案,对模型能力增量扩展与适配器组合有工程价值。
- 论文公开站arXiv
通过输出后处理实现黑盒生成式AI的统计属性对齐
Statistical attribute alignment for black-box generative AI via output post-processing
摘要显示,该研究针对黑盒生成式AI提出输出后处理方法,使生成输出中某属性(如性别、种族、年龄等受保护属性)的分布与用户指定目标分布对齐,适用于公平性与合成数据生成等场景。作者针对精确与近似对齐分别设计算法,最小化对生成器的期望查询次数,并证明当请求输出数m趋于无穷时算法具有最优性。在文本到图像生成与地理编码人物生成任务上的实验表明,该后处理算法可改善统计属性对齐,与基于提示词的干预形成互补。
意义:为开发者提供不依赖模型内部结构的黑盒后处理方案,可在公平性与合成数据场景中低成本控制输出属性分布。
- 资讯公开站Electrek
特斯拉 Optimus 周产量升至数百台,但机器人无法泛化
Tesla ramps Optimus to hundreds a week, but the robots can’t generalize
摘要显示,特斯拉在弗里蒙特工厂已实现每周生产数百台Optimus人形机器人,约为第二季度产量的10倍。但报告指出,下线机器人仍无法处理通用任务,手部结构脆弱、装配线零件错位,供应商也难以在放量下维持质量。泛化能力与可靠性被视为决定人形机器人能否盈利的两大关键问题。
意义:人形机器人量产爬坡与泛化能力脱节,提示开发者:硬件放量不等于通用智能落地,可靠性与泛化仍是商业化瓶颈。
- 论文公开站arXiv
PoEM:从现有策略预测强化学习结果
PoEM: Predicting RL Outcomes from Existing Policies
摘要显示,该研究提出 PoEM 框架,尝试在不重新运行强化学习的情况下预测新奖励函数下的策略结果。若新奖励可表示为已有奖励的线性组合,则新策略在对数空间中也可表示为已有对数策略的线性组合;即使奖励非线性相关,不同奖励训练出的对数策略也常近似张成低秩子空间。基于此,仅用奖励或基策略在样本上的输出即可估计组合权重,从而近似目标 RL 策略。实验在文本与图像模态的合成及真实奖励上验证了该方法。
意义:若成立,可大幅降低奖励模型变更或多奖励组合时的重复 RL 后训练成本,为开发者提供低成本策略预测与评估途径。
- 资讯公开站Ars Technica
谷歌首个 Suncatcher 轨道数据中心 10 月 1 日测试发射
Google's first Suncatcher orbital data center test launches October 1
摘要显示,谷歌计划于10月1日发射其首个实验性轨道数据中心 Suncatcher。该试验平台搭载四块 TPU,且每次仅运行15分钟。目前公开信息有限,尚未披露卫星平台、发射载具及试验目标等细节。
意义:把 AI 算力送上轨道是数据中心形态的极端探索,短期运行与少量 TPU 表明仍处早期验证阶段,对散热、供电与星地通信有参考价值。