- 论文公开站arXiv
LimiX-2:面向通用结构化数据智能的上下文机制网络
LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence
摘要显示,LimiX-2 是 LimiX 家族新模型,依据既有缩放律进行模型与数据扩展,采用上下文机制网络(CMN)范式并以 Context-Conditional Masked Modeling 预训练。CMN 将上下文学习的组织原则从以目标为中心的预测转向机制导向的联合建模,学习 p(x, y | D_context) 而非传统表格 PFN 的 p(y | x, D_context)。预训练数据由结构因果模型生成。在 TabAren…
意义:为表格/结构化数据提供新的基础模型范式,兼顾预测性能与因果可解释性,对表格 AI 与因果发现方向有参考价值。
- 论文公开站arXiv
基于智能体方法的活动数据收集、出行行为建模与天气敏感需求预测
An Agentic Approach for Active Data Collection, Travel Behavior Modeling, and Weather-Sensitive Demand Prediction
摘要显示,本研究提出一个三智能体工作流,整合对话式数据收集、结构化数据处理和行为预测。通过聊天机器人管理的图像增强陈述偏好调查,收集了454条学生通勤者在五种天气情景下的出行方式选择数据。使用多项逻辑模型分析天气关联,并以逻辑回归和随机森林作为机器学习基准。评估了九个本地部署的大语言模型,范围从2亿到350亿参数,在四种零样本提示条件下,并扩展了角色、少样本和视觉配置。最佳文本零样本LLM达到69.9%的准确率,而最佳视觉配置达到71.…
意义:该研究展示了大语言模型在出行行为预测中的潜力,并比较了不同提示策略的效果,为开发天气敏感的智能出行服务提供了新思路。
- 开源项目公开站GitHub
Firecrawl:面向大规模网页搜索、抓取与交互的上下文API
firecrawl/firecrawl — The context API to search, scrape, and interact with the web at scale. 🔥
Firecrawl 是一个开源的上下文 API,用于大规模地搜索、抓取网页并与之交互。它支持将整个网站转换为干净的 Markdown 或结构化数据,提供爬虫、抓取和搜索功能,并可通过 API 调用,适用于 AI 应用的数据收集与处理。该项目在 GitHub 上已获得超过 17 万星标。
意义:为 AI 应用提供便捷的网页数据获取与转换工具,简化数据预处理流程,可能促进更多 AI 项目的开发。