全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「LLM」共 112 条

  • 开源项目公开站GitHub

    从零开始用PyTorch实现ChatGPT式大语言模型的逐步教程

    rasbt/LLMs-from-scratch — Implement a ChatGPT-like LLM in PyTorch from scratch, step by step

    该GitHub仓库提供从零开始用PyTorch实现ChatGPT式大语言模型的详细教程。内容涵盖数据准备、模型架构、训练与微调等步骤,旨在帮助开发者深入理解LLM内部机制。仓库已获得超过10万星标,表明其受欢迎程度和实用性。

    意义:为开发者提供从零构建LLM的实战指南,有助于深入理解Transformer架构和训练细节,是学习和研究大模型的重要资源。

  • 论文公开站arXiv

    从法规到实施:LLM辅助行业合规的关键评估

    From Regulation to Implementation: A Critical Evaluation of LLM-Assisted Regulatory Compliance in Industry

    欧盟在可持续发展和隐私法规方面处于领先地位,但合规文档如数字产品护照(DPP)和数据保护影响评估(DPIA)的创建面临挑战。工业数据格式异构且分散,DPIA缺乏标准化。研究提出使用LLM生成合规文档,但数据提取指令和法规模糊性对输出质量的影响未充分探讨。本文通过基准测试不同模型与人工创建的真实模式对比,评估了这些因素对LLM生成的合规工件质量和一致性的影响。

    意义:为LLM在合规文档生成中的应用提供了关键评估,揭示了数据提取和法规模糊性对输出的影响,对开发可靠的合规自动化工具具有重要意义。

  • 论文公开站arXiv

    自精炼流水线中的非对称容量分配研究

    Asymmetric Capacity Allocation in Self-Refinement Pipelines

    自精炼(生成、批评、修订)是提升大模型生成能力的常用范式,但现有方法多将模型大小视为实现细节而非研究对象。本文首次对自精炼流程进行分阶段模型规模研究,基于Qwen3和Gemma 3的多个尺寸在5个基准上实验,发现较大生成器和修订者通常提升性能,而过小的修订者可能损害性能;批评者大小对性能影响不敏感,但包含小型批评者仍优于完全省略。

    意义:为多阶段LLM系统提供容量分配指导,避免资源浪费,助力构建计算高效的自精炼流水线。

  • 主题公开站Google News · LLM

    LLM未来趋势:多模态融合、自主Agent与AGI展望

    LLM的未来趋势:多模态、Agent与AGI展望

    摘要显示,LLM的发展方向包括多模态融合与自主Agent,这些技术将推动人工智能向AGI迈进。文章展望了这些趋势对未来AI的影响,并引发读者对技术演进和潜在挑战的思考。

    意义:帮助开发者把握LLM技术演进方向,关注多模态与Agent等关键领域,为产品研发和职业规划提供参考。

  • 广告山力士绿滨筋膜枪智能筋膜枪筋膜按摩枪全身按摩器新款 标准按键款京东新款样本,适合先看规格与上架节奏再决定是否入手。京东¥123 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    LLM缓存应使用哪种驱逐策略?跨工作负载、容量和编码器的系统研究

    Which Eviction Policy Should an LLM Cache Use? A Systematic Study Across Workloads, Capacities, and Encoders

    摘要显示,使用CLEVER协议评估了FIFO、LRU、LFU、ARC、GDSF、流式SISO及语义冗余策略,在18种设置中,无策略优于LFU超过0.041个百分点。FIFO和流式SISO在紧容量下落后LFU达8.67和8.55个百分点。条件打包结果解释了改进缺失。审计发现,在MiniLM中位阈值下,仅2.1-3.9%的命中可替换答案,质量调整后命中率从51-60%降至1.1-2.2%。阈值不跨编码器迁移。LFU是最强简单默认策略。

    意义:为LLM缓存驱逐策略提供了系统比较,指出LFU作为强默认选择,并强调答案有效性验证的重要性,对缓存系统设计有指导意义。

  • 论文公开站arXiv

    注入、对齐、恢复:面向无检索文档知识内化的分阶段后训练框架

    Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization

    大型语言模型在推理时无法检索源文档时,往往难以回答关于特定文档集的问题。为此,本文提出IAR(注入、对齐、恢复)三阶段后训练框架,将固定语料转化为可用的参数化知识,实现无检索问答。注入阶段采用续写、改写和指令条件重建目标;对齐阶段使用仅答案的问答监督;恢复阶段合并领域适配模型与基础指令模型以恢复通用能力。实验显示,在多个模型家族和数据集上,IAR在领域问答准确率上平均提升3.6个百分点,通用性能平均提升12.1个百分点。

    意义:该框架为无需检索的文档知识内化提供了新方法,提升领域问答准确率的同时保持通用能力,对构建高效、实用的领域专用模型具有重要意义。

  • 论文公开站arXiv

    潘多拉AI模型路由盒:代价高昂的价值估计下的高效分配

    Pandora's AI Model Routing Box: Efficient Allocation with Costly Value Estimation

    摘要显示,异构AI系统通过路由查询至最有效且成本最低的专家模型,可提升质量与效率,但价值估计需付出代价。该研究将这一权衡形式化为潘多拉盒子问题,在高斯信号模型下推导出闭式信息价值表达式,提出集中式路由策略Pandora's Router和去中心化策略Pandora's Bidder。实验表明,Pandora's Router在匹配穷举估计路由质量的同时,显著减少昂贵估计器的调用次数。

    意义:为AI系统提供成本感知的路由策略,降低多模型推理开销,对构建高效、经济的LLM服务具有直接指导意义。

  • 论文公开站arXiv

    AI4AI-Bench:面向递归自我改进的算法设计LLM智能体基准测试

    AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement

    AI4AI-Bench包含10个冻结的研究代码库,覆盖10种训练算法族。智能体需在4小时内重写训练算法,随后重新运行最多12小时,由固定评估器评分。基准将指标统一映射,0表示无信息模型,0.1为原始算法,1.0为任务最优。在6个系统的29种配置下,平均得分为0.166,最佳系统达0.250,表明现有智能体在算法设计上仍有很大提升空间。

    意义:该基准首次隔离评估LLM智能体的算法设计能力,对递归自我改进可行性研究至关重要,为AI自我提升提供量化测试平台。

  • 广告德国筋膜枪肌肉按摩器颈膜抢男士女生专用高端理疗级2026新款 筋膜枪-按…京东新款样本,适合先看规格与上架节奏再决定是否入手。京东¥89 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    基于智能体方法的活动数据收集、出行行为建模与天气敏感需求预测

    An Agentic Approach for Active Data Collection, Travel Behavior Modeling, and Weather-Sensitive Demand Prediction

    摘要显示,本研究提出一个三智能体工作流,整合对话式数据收集、结构化数据处理和行为预测。通过聊天机器人管理的图像增强陈述偏好调查,收集了454条学生通勤者在五种天气情景下的出行方式选择数据。使用多项逻辑模型分析天气关联,并以逻辑回归和随机森林作为机器学习基准。评估了九个本地部署的大语言模型,范围从2亿到350亿参数,在四种零样本提示条件下,并扩展了角色、少样本和视觉配置。最佳文本零样本LLM达到69.9%的准确率,而最佳视觉配置达到71.…

    意义:该研究展示了大语言模型在出行行为预测中的潜力,并比较了不同提示策略的效果,为开发天气敏感的智能出行服务提供了新思路。

  • 开源项目公开站GitHub

    LangChain:智能体工程平台

    langchain-ai/langchain — The agent engineering platform.

    LangChain是一个智能体工程平台,旨在帮助开发者构建基于大型语言模型的应用程序。它提供了模块化组件,用于链式调用、记忆管理、工具集成等,支持多种模型提供商。该平台拥有庞大的社区和丰富的文档,是构建LLM应用的主流框架之一。

    意义:作为主流LLM框架,LangChain降低了构建复杂智能体的门槛,其生态和工具链对AI应用开发至关重要。

  • 开源项目公开站GitHub

    微软 Semantic Kernel:快速集成前沿大语言模型到应用中

    microsoft/semantic-kernel — Integrate cutting-edge LLM technology quickly and easily into your apps

    Semantic Kernel 是微软推出的开源 SDK,旨在帮助开发者轻松地将大语言模型(LLM)集成到应用程序中。它支持多种编程语言,提供插件、规划器等功能,简化 AI 功能的开发与部署。该仓库在 GitHub 上已获得 28,480 颗星,受到广泛关注。

    意义:为开发者提供标准化的 LLM 集成框架,降低 AI 应用开发门槛,加速 AI 功能落地,是微软在 AI 开发工具领域的重要布局。

  • 开源项目公开站GitHub

    minimind:2小时从零训练64M参数大语言模型

    jingyaogong/minimind — 🧠 Train a 64M-parameter LLM from scratch in just 2h!

    GitHub项目minimind展示了从零开始训练一个仅64M参数的大语言模型,训练时间仅需2小时。该项目提供了完整的训练流程和代码,旨在降低LLM训练门槛,让开发者能够快速上手并理解大模型的基本原理。项目在GitHub上已获得超过5万星标。

    意义:对开发者而言,降低了训练大模型的门槛,有助于快速理解LLM训练流程;对AI行业,展示了轻量化模型的高效训练可能性。

  • 广告弯头筋膜枪电动按摩棒捶背加长筋膜锤背部敲击按摩锤长柄筋膜枪2026新款5…京东新款样本,适合先看规格与上架节奏再决定是否入手。京东¥1.19 · 精选自 全球电商每日爆款去看看