全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「大语言模型」共 17 条

  • 资讯公开站rss_arxiv_cs_ai

    有效的大语言模型微调是否必须依赖人类可读文本?

    Is Human-Readable Text Necessary for Effective LLM Fine-Tuning?

    arXiv:2609.35868v1 公告类型:新 摘要:有效微调大语言模型是否必须依赖人类可读性?我们研究模型条件化的训练表示能否在无需人类可读文本形式的情况下保持或提升适配效用。我们提出 Desired-Update-Aligned Synthetic Data(DASA),利用冻结参考模型的激活梯度反馈来指导连续合成输入嵌入的优化。受激活梯度在局部风险降低中作用的启发,DASA 针对有用的适配更新,而非源文本重建或语言流畅性。所得…

  • 论文公开站arXiv

    打破同质化陷阱:通过SplitMoE扩展视频扩散模型

    Breaking the Uniformity Trap: Scaling Video Diffusion Model via SplitMoE

    受大语言模型启发的混合专家(MoE)是扩展视觉生成模型的有前景范式,但传统token级MoE在同类专家池中独立路由token并趋向均匀化,限制了性能。本文提出SplitMoE方法。

  • 资讯公开站rss_arxiv_cs_ai

    通过嵌入式编码改进大语言模型的医学计算能力

    Improving Medical Calculation of LLMs with Embedded Coding

    arXiv:2609.31908v1 公告类型:新 摘要:大语言模型(LLM)在医学考试和问答基准上表现良好,但在需要精确数值输出的医学计算任务上仍不可靠。这些计算支撑着用药剂量、器官功能评估和预后评分等高风险决策,即使很小的误差也可能带来严重的临床后果。我们提出 MedCode,一个通过训练 LLM 生成嵌入式可执行代码来改进医学计算的框架。给定临床情境,模型识别相关计算器,提取其输入变量,并生成一段将算术运算委托给确定性解释器的脚本…

  • 论文公开站arXiv

    大语言模型用于结构化临床数据分析:双智能体接地与验证

    Large Language Models for Structured Clinical Data Analysis: Dual-Agent Grounding and Validation

    目标:开发并表征 CLEAR-Med,一种用于结构化临床数据自然语言分析的双智能体框架,将基于 SQL 的调用与独立验证分离。方法:CLEAR-Med 使用一个智能体将问题转化为可执行的结构化查询。

  • 广告中兴U15随身wifi6带充电宝功能高速上网曲面握感18W快充10000…新款·淘宝·市场见相关商品上架/在售信号淘宝¥199 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    Kafila:在可信异构消费级机器集合上服务大语言模型

    Kafila: Serving Large Language Models on a Trusted Set of Heterogeneous Commodity Machines

    研究组成员或朋友圈各自拥有几台消费级计算机,但单台都不足以运行一个有能力的大语言模型。现有系统在开放集群中汇聚此类算力,而仅接纳可信机器的群体则无法使用。

  • 资讯公开站Ars Technica

    佛罗里达州以灭绝担忧为由提起法律诉讼,要求阻止 OpenAI 开发

    Florida invokes extinction fears in legal bid to halt OpenAI development

  • 资讯公开站Semiconductor Engineering

    智能体AI自动修复设计规则并保持版图等价(普渡大学)

    Agentic AI Automates Design-Rule Repair While Preserving Layout Equivalence (Purdue University)

    摘要显示,普渡大学研究人员发表技术论文《DRC-Aid: Design-Rule Correction via Agentic Framework utilizing Inference-Time Large Language Models》,提出一种闭环智能体框架,将局部设计规则检查(DRC)修复建模为「验证在环搜索」。为约束组合爆炸的几何修复空间,该方法用确定性规则引擎转换物理验证工具报告的信息。论文称可在保持版图等价的前提下自动完…

    意义:若方法成立,可将芯片物理验证中耗时的人工DRC修复环节自动化,为LLM智能体进入EDA流程提供可验证的工程范式。

  • 论文公开站arXiv

    分数中心化稳定离策略强化学习

    Score Centering Stabilizes Off-policy Reinforcement Learning

    摘要显示,大语言模型强化学习对训练引擎与推理引擎之间的微小差异(训练-推理不匹配,TIM)高度敏感,而完全消除 TIM 会显著牺牲 rollout 效率。作者认为 TIM 下 RL 不稳定的主因是「漂移」——训练与推理引擎间随训练步数累积的持续偏差,并提出加性的「分数中心化」修正项来抵消漂移。在 0.6B 至 30B 参数模型上,该方法在量化条件下匹配或优于基于重要性采样的方法,且不匹配越严重优势越大;由于修正是加性的,它还能与重要性采…

    意义:为 LLM 强化学习训练中普遍存在的训练-推理引擎不一致问题提供了一种轻量、可组合的稳定性修正,有助于在不牺牲 rollout 效率的前提下提升大规模 RL 训练稳定性。

  • 广告小米REDMI显示器A27U Type-C 120Hz2027款27英寸…新款·淘宝·小米相关相关商品上架/在售信号淘宝¥1999 · 精选自 全球电商每日爆款去看看
  • 资讯公开站Ars Technica

    使用AI水印时,LLM对有害提示的响应不同

    LLMs respond differently to harmful prompts when AI watermarking is used

    摘要显示,当使用SynthID等AI水印技术时,大语言模型对有害提示的反应会发生变化:原本会拒绝的有害指令,在水印机制下可能被模型执行。这表明水印嵌入过程可能削弱模型的安全对齐,使其更易受对抗性提示影响。

    意义:提醒开发者:内容水印可能引入新的安全风险,需在部署前评估其对模型对齐与对抗鲁棒性的影响。

  • 论文公开站arXiv

    部分知识下的约束实体选择:面向LLM知识图谱问答

    Constrained Entity Selection under Partial Knowledge for LLM-Based Knowledge Graph QA

    该论文研究大语言模型在知识图谱问答中的实体选择问题,提出CES-PK框架,利用轻量级符号约束(类型、关系、排除)过滤无效候选答案,并采用三值语义(满足、违反、未知)处理不完整知识图谱。在Hetionet生物医学知识图谱上的实验显示,该方法能提升精确率,同时保持召回率。

    意义:提供一种无需完整语义解析即可提升KGQA可靠性的方法,对构建可验证的LLM问答系统有参考价值。

  • 论文公开站arXiv

    双维度LLM框架用于大规模测评中题目非内容相似性自动分析

    A Dual-Dimensional LLM Framework for Automated Item Incidental Content Similarity Analysis in Large-Scale Assessments

    该研究提出一种基于大语言模型的双维度自动题目相似性分析框架,通过结构化分解和语义相关性来检测题目中非内容冗余。心理测量验证显示,LLM指标比传统文本指标更接近构念无关局部依赖,并产生更一致的题目参数分组。在计算机自适应测试中,基于LLM的相似性约束提高了估计稳定性并减少了偏差。

    意义:为大规模题库管理提供新方法,提升自适应测试的准确性和效率,对教育测评AI应用有重要价值。

  • 论文公开站arXiv

    读取不等于使用:检索、判断与AI金融研究工作流的设计

    Reading Is Not Using: Retrieval, Judgment, and the Design of AI Financial Research Workflows

    摘要显示,大型语言模型在金融分析中的评估通常基于检索能力,而非检索信息对判断的影响。研究发现,在长上下文金融分析中存在“检索-整合缺口”:当无关上下文从2000增至128000个token时,风险披露对投资判断的影响降至噪声水平,尽管直接检索仍准确。该现象在多个模型家族和任务中复现,且更强大的模型仅推迟而非消除此缺口。因果记忆干预表明,压缩摘要和源文本查找共同传递披露信息,而工作流架构(如分块-总结流水线会逐出相关信息)决定传递成败。因…

    意义:对AI行业而言,提示了仅靠检索评估的不足,强调工作流设计对模型实际决策的影响,为金融AI系统开发提供关键考量。

  • 广告小米手环11智能运动健康防水手表血氧睡眠心率监测男女款微信支付宝11NF…新款·淘宝·小米相关相关商品上架/在售信号淘宝¥375.29 · 精选自 全球电商每日爆款去看看
  • 开源项目公开站GitHub

    从零开始用PyTorch实现ChatGPT式大语言模型的逐步教程

    rasbt/LLMs-from-scratch — Implement a ChatGPT-like LLM in PyTorch from scratch, step by step

    该GitHub仓库提供从零开始用PyTorch实现ChatGPT式大语言模型的详细教程。内容涵盖数据准备、模型架构、训练与微调等步骤,旨在帮助开发者深入理解LLM内部机制。仓库已获得超过10万星标,表明其受欢迎程度和实用性。

    意义:为开发者提供从零构建LLM的实战指南,有助于深入理解Transformer架构和训练细节,是学习和研究大模型的重要资源。

  • 论文公开站arXiv

    注入、对齐、恢复:面向无检索文档知识内化的分阶段后训练框架

    Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization

    大型语言模型在推理时无法检索源文档时,往往难以回答关于特定文档集的问题。为此,本文提出IAR(注入、对齐、恢复)三阶段后训练框架,将固定语料转化为可用的参数化知识,实现无检索问答。注入阶段采用续写、改写和指令条件重建目标;对齐阶段使用仅答案的问答监督;恢复阶段合并领域适配模型与基础指令模型以恢复通用能力。实验显示,在多个模型家族和数据集上,IAR在领域问答准确率上平均提升3.6个百分点,通用性能平均提升12.1个百分点。

    意义:该框架为无需检索的文档知识内化提供了新方法,提升领域问答准确率的同时保持通用能力,对构建高效、实用的领域专用模型具有重要意义。

  • 论文公开站arXiv

    基于智能体方法的活动数据收集、出行行为建模与天气敏感需求预测

    An Agentic Approach for Active Data Collection, Travel Behavior Modeling, and Weather-Sensitive Demand Prediction

    摘要显示,本研究提出一个三智能体工作流,整合对话式数据收集、结构化数据处理和行为预测。通过聊天机器人管理的图像增强陈述偏好调查,收集了454条学生通勤者在五种天气情景下的出行方式选择数据。使用多项逻辑模型分析天气关联,并以逻辑回归和随机森林作为机器学习基准。评估了九个本地部署的大语言模型,范围从2亿到350亿参数,在四种零样本提示条件下,并扩展了角色、少样本和视觉配置。最佳文本零样本LLM达到69.9%的准确率,而最佳视觉配置达到71.…

    意义:该研究展示了大语言模型在出行行为预测中的潜力,并比较了不同提示策略的效果,为开发天气敏感的智能出行服务提供了新思路。

  • 开源项目公开站GitHub

    微软 Semantic Kernel:快速集成前沿大语言模型到应用中

    microsoft/semantic-kernel — Integrate cutting-edge LLM technology quickly and easily into your apps

    Semantic Kernel 是微软推出的开源 SDK,旨在帮助开发者轻松地将大语言模型(LLM)集成到应用程序中。它支持多种编程语言,提供插件、规划器等功能,简化 AI 功能的开发与部署。该仓库在 GitHub 上已获得 28,480 颗星,受到广泛关注。

    意义:为开发者提供标准化的 LLM 集成框架,降低 AI 应用开发门槛,加速 AI 功能落地,是微软在 AI 开发工具领域的重要布局。

  • 广告挂腰风扇2026新款户外制冷小风扇便携式小型夹腰间暴力风户外露营高温作业…联盟新款物料,适合对照规格与到手价再决定是否入手。淘宝¥250.98 · 精选自 全球电商每日爆款去看看
  • 开源项目公开站GitHub

    minimind:2小时从零训练64M参数大语言模型

    jingyaogong/minimind — 🧠 Train a 64M-parameter LLM from scratch in just 2h!

    GitHub项目minimind展示了从零开始训练一个仅64M参数的大语言模型,训练时间仅需2小时。该项目提供了完整的训练流程和代码,旨在降低LLM训练门槛,让开发者能够快速上手并理解大模型的基本原理。项目在GitHub上已获得超过5万星标。

    意义:对开发者而言,降低了训练大模型的门槛,有助于快速理解LLM训练流程;对AI行业,展示了轻量化模型的高效训练可能性。