全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「大语言模型」共 9 条

  • 论文公开站arXiv

    打破同质化陷阱:通过SplitMoE扩展视频扩散模型

    Breaking the Uniformity Trap: Scaling Video Diffusion Model via SplitMoE

    受大语言模型启发的混合专家(MoE)是扩展视觉生成模型的有前景范式,但传统token级MoE在同类专家池中独立路由token并趋向均匀化,限制了性能。本文提出SplitMoE方法。

  • 论文公开站arXiv

    大语言模型用于结构化临床数据分析:双智能体接地与验证

    Large Language Models for Structured Clinical Data Analysis: Dual-Agent Grounding and Validation

    目标:开发并表征 CLEAR-Med,一种用于结构化临床数据自然语言分析的双智能体框架,将基于 SQL 的调用与独立验证分离。方法:CLEAR-Med 使用一个智能体将问题转化为可执行的结构化查询。

  • 论文公开站arXiv

    Kafila:在可信异构消费级机器集合上服务大语言模型

    Kafila: Serving Large Language Models on a Trusted Set of Heterogeneous Commodity Machines

    研究组成员或朋友圈各自拥有几台消费级计算机,但单台都不足以运行一个有能力的大语言模型。现有系统在开放集群中汇聚此类算力,而仅接纳可信机器的群体则无法使用。

  • 论文公开站arXiv

    分数中心化稳定离策略强化学习

    Score Centering Stabilizes Off-policy Reinforcement Learning

    摘要显示,大语言模型强化学习对训练引擎与推理引擎之间的微小差异(训练-推理不匹配,TIM)高度敏感,而完全消除 TIM 会显著牺牲 rollout 效率。作者认为 TIM 下 RL 不稳定的主因是「漂移」——训练与推理引擎间随训练步数累积的持续偏差,并提出加性的「分数中心化」修正项来抵消漂移。在 0.6B 至 30B 参数模型上,该方法在量化条件下匹配或优于基于重要性采样的方法,且不匹配越严重优势越大;由于修正是加性的,它还能与重要性采…

    意义:为 LLM 强化学习训练中普遍存在的训练-推理引擎不一致问题提供了一种轻量、可组合的稳定性修正,有助于在不牺牲 rollout 效率的前提下提升大规模 RL 训练稳定性。

  • 广告12V40a开关电源220转12V工业电源变压器10a20A30a500…新款·淘宝·市场见相关商品上架/在售信号淘宝¥14.45 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    部分知识下的约束实体选择:面向LLM知识图谱问答

    Constrained Entity Selection under Partial Knowledge for LLM-Based Knowledge Graph QA

    该论文研究大语言模型在知识图谱问答中的实体选择问题,提出CES-PK框架,利用轻量级符号约束(类型、关系、排除)过滤无效候选答案,并采用三值语义(满足、违反、未知)处理不完整知识图谱。在Hetionet生物医学知识图谱上的实验显示,该方法能提升精确率,同时保持召回率。

    意义:提供一种无需完整语义解析即可提升KGQA可靠性的方法,对构建可验证的LLM问答系统有参考价值。

  • 论文公开站arXiv

    双维度LLM框架用于大规模测评中题目非内容相似性自动分析

    A Dual-Dimensional LLM Framework for Automated Item Incidental Content Similarity Analysis in Large-Scale Assessments

    该研究提出一种基于大语言模型的双维度自动题目相似性分析框架,通过结构化分解和语义相关性来检测题目中非内容冗余。心理测量验证显示,LLM指标比传统文本指标更接近构念无关局部依赖,并产生更一致的题目参数分组。在计算机自适应测试中,基于LLM的相似性约束提高了估计稳定性并减少了偏差。

    意义:为大规模题库管理提供新方法,提升自适应测试的准确性和效率,对教育测评AI应用有重要价值。

  • 论文公开站arXiv

    读取不等于使用:检索、判断与AI金融研究工作流的设计

    Reading Is Not Using: Retrieval, Judgment, and the Design of AI Financial Research Workflows

    摘要显示,大型语言模型在金融分析中的评估通常基于检索能力,而非检索信息对判断的影响。研究发现,在长上下文金融分析中存在“检索-整合缺口”:当无关上下文从2000增至128000个token时,风险披露对投资判断的影响降至噪声水平,尽管直接检索仍准确。该现象在多个模型家族和任务中复现,且更强大的模型仅推迟而非消除此缺口。因果记忆干预表明,压缩摘要和源文本查找共同传递披露信息,而工作流架构(如分块-总结流水线会逐出相关信息)决定传递成败。因…

    意义:对AI行业而言,提示了仅靠检索评估的不足,强调工作流设计对模型实际决策的影响,为金融AI系统开发提供关键考量。

  • 论文公开站arXiv

    注入、对齐、恢复:面向无检索文档知识内化的分阶段后训练框架

    Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization

    大型语言模型在推理时无法检索源文档时,往往难以回答关于特定文档集的问题。为此,本文提出IAR(注入、对齐、恢复)三阶段后训练框架,将固定语料转化为可用的参数化知识,实现无检索问答。注入阶段采用续写、改写和指令条件重建目标;对齐阶段使用仅答案的问答监督;恢复阶段合并领域适配模型与基础指令模型以恢复通用能力。实验显示,在多个模型家族和数据集上,IAR在领域问答准确率上平均提升3.6个百分点,通用性能平均提升12.1个百分点。

    意义:该框架为无需检索的文档知识内化提供了新方法,提升领域问答准确率的同时保持通用能力,对构建高效、实用的领域专用模型具有重要意义。

  • 广告14v开关电源DC14v变压器直流电源14V2A3A5A10A20A工业…新款·淘宝·市场见相关商品上架/在售信号淘宝¥18 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    基于智能体方法的活动数据收集、出行行为建模与天气敏感需求预测

    An Agentic Approach for Active Data Collection, Travel Behavior Modeling, and Weather-Sensitive Demand Prediction

    摘要显示,本研究提出一个三智能体工作流,整合对话式数据收集、结构化数据处理和行为预测。通过聊天机器人管理的图像增强陈述偏好调查,收集了454条学生通勤者在五种天气情景下的出行方式选择数据。使用多项逻辑模型分析天气关联,并以逻辑回归和随机森林作为机器学习基准。评估了九个本地部署的大语言模型,范围从2亿到350亿参数,在四种零样本提示条件下,并扩展了角色、少样本和视觉配置。最佳文本零样本LLM达到69.9%的准确率,而最佳视觉配置达到71.…

    意义:该研究展示了大语言模型在出行行为预测中的潜力,并比较了不同提示策略的效果,为开发天气敏感的智能出行服务提供了新思路。