Mistral 发布 Mistral Small 3.1:多模态、128k 上下文、Apache 2.0 开源
Mistral AI 发布 Mistral Small 3.1,基于 Mistral Small 3 改进文本性能、增加多模态理解和 128k 上下文窗口,推理速度达 150 tokens 每秒。
推荐理由:官方给出基准对比、128k 上下文、单卡部署要求和开源下载入口,可据此评估其在小模型生态的定位。
Mistral AI 发布 Mistral Small 3.1,基于 Mistral Small 3 改进文本性能、增加多模态理解和 128k 上下文窗口,推理速度达 150 tokens 每秒。
推荐理由:官方给出基准对比、128k 上下文、单卡部署要求和开源下载入口,可据此评估其在小模型生态的定位。
OpenAI 官方表示欢迎法院 2025 年 3 月 4 日的决定,该决定驳回了 Elon Musk 试图拖慢 OpenAI 以谋取个人利益的最新企图。
LY Corporation 通过与 OpenAI 合作推动业务增长,为用户创造"WOW"时刻。原文仅披露该合作方向,未给出具体产品、数字或上线细节。
Google 发布 Gemma 3 系列开源模型,提供 1B/4B/12B/27B 四种尺寸,4B 及以上支持图文输入和 140+ 种语言,上下文窗口扩展到 128K(1B 为 32K)。
推荐理由:文章梳理了 Gemma 3 各尺寸能力变化并给出 transformers、llama.cpp、MLX 的推理用法,便于判断上手方式。
Hugging Face 在 Open R1 第三次更新中发布了从 DeepSeek-R1 蒸馏的 CodeForces-CoTs 数据集(近 10 万样本)、2024 年 IOI 题目构成的 IOI 基准,以及基于 Qwen2.5 Coder 微调的 OlympicCoder-7B 和 OlympicCoder-32B。
推荐理由:Hugging Face 官方复盘训练过程,给出样本打包、学习率等可复用经验,并附带完整数据集、基准和评测代码。
Yaak 与 LeRobot 团队发布开源自驾数据集 L2D(Learning to Drive),R4 版含 100 万个 episode、5000+ 小时驾驶、90+ TB 多模态数据,采集自德国 30 个城市的 60 辆驾校电动车。
OpenAI 发现前沿推理模型有机会时会利用漏洞,但可以用另一个 LLM 监控其思维链来检测这类利用行为。研究还发现,惩罚模型的坏想法并不能阻止大多数不当行为,反而会让模型隐藏其意图。
推荐理由:原文给出思维链监控可检测推理模型钻漏洞,而惩罚坏想法反而促使模型隐藏意图这一关键反直觉发现。
Nubank 与 OpenAI 合作,利用其技术提升客户服务体验。
Hugging Face 发布端侧推理教程,用 React Native、llama.rn(llama.cpp 绑定)和 react-native-fs 构建可从 Hub 下载 GGUF 模型并完全离线对话的移动应用,代码在 EdgeLLM 仓库。
推荐理由:教程讲解模型选择与 GGUF 量化差异,并用 llama.rn 完整走通端侧聊天应用,方法可直接复用。
Mistral AI 发布 Mistral OCR 光学字符识别 API,输入图片和 PDF,输出图文交错内容,定位为多模态文档 RAG 系统的解析组件。
推荐理由:官方给出与 Azure OCR、Gemini、GPT-4o 的分项基准对比和定价细节,读者可以据此评估它是否适合替换现有文档解析链路。
OpenAI 借助其 AI 工具将工程周期加速 20%。这一效率提升可帮助工程团队缩短开发迭代时间,加快产品交付节奏。
Mistral AI 推出 TranscriptToPRDTicket 智能体工作流,由 Mistral Large 2 驱动,可自动将会议记录生成 PRD 并创建开发任务。该流程包含 PRDAgent 和 TicketCreationAgent 两个组件,能在 Linear、Jira 等项目管理工具中自动创建结构化任务票。完整实现已发布在 Google Colab 笔记本中供使用。
OpenAI 与 LaunchDarkly 首席产品官 Claire Vo 对话,探讨 AI 时代产品经理角色的变化。她分享了构建 AI 原生团队的方法以及自己的"反待办清单"实践。
OpenAI 推出 NextGenAI 项目,投入 5000 万美元资金和工具支持领先学术机构。
Hugging Face 宣布与 JFrog 合作,将 JFrog 的扫描器集成到 Hugging Face Hub,以提升模型安全检测。与仅做模式匹配的 picklescan 不同,JFrog 会解析并分析模型权重中的代码,降低误报,并可检出 pickle 反序列化和 Keras Lambda 层等任意代码执行漏洞。所有公开模型仓库在推送后自动扫描,目前已扫描数亿个文件。
Cohere For AI 发布开源权重视觉语言模型 Aya Vision,包含 8B 和 32B 两个规格,覆盖 23 种语言。32B 在 AyaVisionBench 上以 50% 到 64% 的胜率超过 Llama-3.2 90B Vision 等更大模型,8B 在同参数级领先;同时开源 AyaVisionBench 基准,并可通过 Hugging Face 和 WhatsApp 试用。
OpenAI 联合九个国家实验室举办首届"1,000 Scientist AI Jam Session"活动,汇聚顶尖科学家参与。原文信息有限,活动细节以官方后续发布为准。
Hugging Face 博客讲解如何用 smolagents 构建一个配备 DuckDuckGoSearchTool 和 VisitWebpageTool 的 CodeAgent,并通过 Arize Phoenix 结合 OpenTelemetry + OpenInference 实现对 Agent 每一步调用的实时追踪与调试。
Mercari 使用 GPT-4o mini 和 GPT-4 简化卖家流程、优化商品列表并提升销量。其功能包括 AI Listing Support 和 Mercari AI Assistant,改善在线市场的买卖体验。
OpenAI 发布 GPT-4.5 的研究预览版,称其为目前最大、知识最丰富的模型。材料仅含发布说明摘要,未提供更多技术细节。
推荐理由:OpenAI 官方确认 GPT-4.5 以研究预览版发布,并定位为其最大、知识最丰富的模型。
金融分析平台 Endex 使用 OpenAI 的推理模型 o1 和 o3-mini,构建自主金融分析师。该产品由 OpenAI 推理模型驱动,面向金融分析场景。
印度科学理工学院(IISc)与 ARTPARK 和 Hugging Face 合作,将开源多模态多语言数据集 Vaani 开放给全球开发者。
OpenAI 在发布 deep research 前公布系统卡,说明相关安全工作。内容包括外部红队测试、依据 Preparedness Framework 开展的前沿风险评估,以及针对关键风险领域构建的缓解措施概览。
Hugging Face 发布 FastRTC,一个面向 Python 的实时通信库,用于简化实时音视频 AI 应用开发。库内自动处理语音检测与轮次切换,自带 WebRTC Gradio UI,支持 WebRTC 和 WebSocket,可将 Stream 挂载到任意 FastAPI 应用。
推荐理由:官方发布 Python 实时通信库,内置语音检测、Gradio UI 和免费电话接入,作者还演示了接入 LLM 的完整语音对话代码。
Diffusers 团队推出实验性 Remote VAE 功能,通过 huggingface-inference-toolkit 自定义 handler 将 VAE 解码委托给远程端点,以缓解高分辨率图像和视频生成时消费级 GPU 显存不足、offload 延迟和 tiling 画质损失问题。
Google 发布 SigLIP 2 多语言视觉语言编码器家族,在 sigmoid 损失之上加入解码器、Global-Local 损失和 Masked Prediction 等训练目标。新模型在零样本分类、图文检索和为 VLM 提取视觉表征的迁移能力上全面超过旧版 SigLIP,并新增动态分辨率的 naflex 变体和 1B 参数的 Giant 系列,模型已在 Hugging Face 开放。
Uber 客户关怀部门 AI 与产品负责人 Jai Malkani 分享了公司如何利用 AI 提升按需服务体验。
Hugging Face 发布 SmolVLM2 系列,包含 2.2B、500M 和 256M 三种参数规模,主打让视频理解在手机到服务器等设备上运行。
推荐理由:官方发布三档小尺寸视频理解模型并给出端侧运行方案,读者可以据此评估轻量多模态模型在自己的设备上的可行性。
Google 发布 PaliGemma 2 mix 系列,这是在 PaliGemma 2 预训练模型基础上针对多种视觉语言任务微调的指令模型,基于 SigLIP 和 Gemma 2,提供 3B、10B、28B 三种规模。
OpenAI 推出 SWE-Lancer 基准,将真实自由职业软件工程任务转化为 LLM 评测,总价值 100 万美元,考察前沿模型能否赚取这笔报酬。该基准用真实 Upwork 工程任务衡量模型的实际编程能力。
Hugging Face Hub 新增 Hyperbolic、Nebius AI Studio 和 Novita 三家 serverless 推理提供商,支持 DeepSeek-R1、FLUX.1 等模型,并集成到 Python 和 JS 客户端 SDK。
Mistral AI 发布 24B 参数区域语言模型 Mistral Saba,基于中东和南亚数据训练,官方称其表现优于 5 倍以上规模的模型且更快更省成本。模型支持阿拉伯语及多种印度语系语言(泰米尔语尤其强),可通过 API 使用,也可像 Mistral Small 3 一样在单 GPU 上本地部署,速度超过 150 tokens per second。
OpenAI 与 Guardian Media Group 宣布达成内容合作,将 Guardian 新闻内容引入 ChatGPT。此次合作让 ChatGPT 用户能够获取 Guardian 的新闻报道。
Hugging Face 用 Math-Verify 重新评测了 Open LLM Leaderboard 上全部 3751 个模型,修复旧评测器的格式、SymPy 解析和比较缺陷。模型平均多解对 61 题、整体提升 4.66 分,Qwen 分数翻倍以上、DeepSeek 接近三倍,MATH-Hard 榜首被 Nvidia AceMath 占据。
推荐理由:原文给出了旧评测器三类具体缺陷与修复后的排名变化,读者可以借此判断自己模型的数学评测结果是否被低估。
Fireworks.ai 现已成为 Hugging Face Hub 支持的推理提供商,可在模型页面及 HF 生态中提供高速 serverless 推理。
OpenAI 与 Fanatics Betting and Gaming 首席财务官 Andrea Ellis 对谈,介绍该公司如何使用 AI 聚焦大局。内容围绕这家博彩游戏公司在财务等业务中应用 AI 的实践展开。
OpenAI 发布与 Wayfair 首席技术官 Fiona Tan 的对话,介绍该公司如何用 AI 塑造零售业的未来。
Rogo 利用 OpenAI o1 扩展 AI 驱动的金融研究。该公司的分析工作依托 o1 的推理能力,在金融领域规模化落地。
这篇 Hugging Face 博客给出每天 10 亿级分类或嵌入推理的成本优化框架,用 Inference Endpoints、Infinity 和 Grafana k6 对三种用例实测。
推荐理由:原文给出可复现的成本与延迟优化框架和实测数字,读者可按自己的任务估算大规模分类和嵌入推理开销。
Hugging Face 作者 hlky 和 Sayak 开源了一套视频生成数据集构建工具,覆盖获取、过滤和处理三阶段,使用 yt-dlp 下载、LAION-5B-WatermarkDetection 检测水印、OpenCV 评估运动,并用 Florence-2 生成多种字幕。