TNG 微调 olmOCR-7B-0225-preview,打造忠实还原页眉页脚的 OCR 引擎
TNG 基于 olmOCR-7B-0225-preview 微调出一款忠实 OCR 引擎,解决原模型忽略页眉页脚信息的问题,已开源到 HuggingFace。团队用 Qwen2.5-VL-72B-Instruct 生成了 8000 份文档的数据集,在 8xH100 节点上训练 2.5 epochs,默认超参数即可取得良好效果。
TNG 基于 olmOCR-7B-0225-preview 微调出一款忠实 OCR 引擎,解决原模型忽略页眉页脚信息的问题,已开源到 HuggingFace。团队用 Qwen2.5-VL-72B-Instruct 生成了 8000 份文档的数据集,在 8xH100 节点上训练 2.5 epochs,默认超参数即可取得良好效果。
OpenAI 发布了对语言学习应用 Speak CEO 兼联合创始人 Connor Zwick 的对话,介绍 Speak 如何用 AI 实现个性化语言学习。
The Washington Post 与 OpenAI 达成合作,将其新闻整合进 ChatGPT。用户在 ChatGPT 中可获得新闻摘要、引文以及指向原始报道的直接链接。
TNG 在 Hugging Face 博客发布 LLM 性能系列第二篇,讲解 prefill 与 decode 两个阶段对延迟、吞吐和 GPU 利用率的影响,并比较 static batching、continuous batching 和 prefill-first 等并发策略。
OpenAI 发布 o3 和 o4-mini 两款新模型,称其为迄今最智能、能力最强的模型,并支持完整的工具调用。
推荐理由:官方宣布 o3 与 o4-mini 两款新模型,主打更强能力与完整工具调用,想了解 OpenAI 推理模型最新进展可由此入手。
OpenAI 发布 o3 与 o4-mini 系统卡,两款模型结合了先进推理能力与完整工具能力。工具能力涵盖网页浏览、Python、图像与文件分析、图像生成、canvas、automations、文件搜索和 memory。
推荐理由:官方说明 o3 与 o4-mini 同时具备推理和完整工具调用能力,读者可据此了解这两个新模型的能力范围。
Princeton 团队推出长上下文语言模型评测基准 HELMET,已入选 ICLR 2025,共评测 59 个模型,发现合成任务(如 NIAH)与真实下游表现相关性差,前沿长上下文模型在复杂任务上仍受限。
Hugging Face 官方博客发文《17 Reasons Why Gradio Isn't Just Another UI Library》,称 Gradio 不只是 Python UI 库,而是可通过 UI 和 API 与机器学习模型交互的框架。
Cohere 正式成为 Hugging Face Hub 支持的 Inference Provider,也是首个在 Hub 上直接分享并提供模型推理的模型创建方。
OpenAI 宣布任命 4 位新顾问,为其公益慈善工作提供咨询支持。这些顾问将帮助指导 OpenAI 的非营利相关举措。
OpenAI 发布了更新版 Preparedness Framework,用于衡量和防范前沿 AI 能力可能带来的严重危害。该框架旨在评估前沿模型的风险并采取相应防护措施。
OpenAI 在 API 中发布 GPT-4.1 系列模型,在编码、指令遵循和长上下文理解方面有显著提升,同时发布其首个 nano 模型,即日起面向全球开发者开放。
推荐理由:官方宣布 GPT-4.1 系列上线 API,编码、指令遵循与长上下文能力全面提升,还推出了首个 nano 模型。
Hugging Face 宣布收购开源机器人公司 Pollen Robotics,这是其第五次收购,将开售旗舰人形机器人 Reachy 2,售价 $70,000,已用于 Cornell 和 Carnegie Mellon 等实验室。
推荐理由:官方宣布收购开源机器人公司并开放 Reachy 2 订购,读者可据此了解 Hugging Face 从软件平台走向机器人硬件的路线。
Protect AI 与 Hugging Face 自 2024 年 10 月合作以来,截至 2025 年 4 月 1 日已扫描 Hub 上 141 万个仓库中的 447 万个模型版本,累计在 51,700 个模型中发现 352,000 个不安全或可疑问题。
巴塞罗那超级计算中心语言技术实验室发布 Visual Salamandra,基于 Salamandra Instructed 7B,集成 SigLIP-So400m 视觉编码器、2 层 MLP 投影层和 late-fusion 技术,可处理单图、多图、视频和纯文本输入。
OpenAI 发布了 BrowseComp,一个用于评估浏览智能体(browsing agents)的基准测试。该基准旨在衡量智能体执行网页浏览任务的能力。
Mistral 介绍用“LLM As A Judge”评估 RAG 系统的方法,即由一个 judge LLM 按 1-10、True/False 或定性等级为 generator LLM 的回答打分。
Cloudflare 与 Hugging Face 达成合作,FastRTC 开发者只需 Hugging Face token 即可使用企业级 WebRTC 基础设施。持有有效 token 的开发者每月可免费传输 10GB 数据,无需信用卡;集成从 FastRTC 0.0.20 起可用,Cloudflare 的 TURN 服务器网络覆盖全球 335 个以上地点。
Inception 联合 MBZUAI 在 Hugging Face 推出 Arabic-Leaderboards Space,整合阿拉伯语 AI 评测,目前包含 AraGen-03-25 和基于 Arabic IFEval 的指令遵循榜单。
OpenAI 与 Canva 联合创始人兼首席产品官 Cameron Adams 展开对谈,探讨 Canva 如何借助 AI 激发用户创造力。
OpenAI 发布 EU Economic Blueprint,提出一系列政策建议,旨在帮助欧洲把握人工智能机遇,推动区域可持续经济增长。该蓝图强调 AI 应"由欧洲开发、在欧洲部署、为欧洲服务"。
Meta 发布 Llama 4 Maverick(约 400B、128 专家)和 Scout(约 109B、16 专家),均为 17B 激活参数的 MoE 原生多模态模型,在最多 40 万亿 token、200 种语言数据上训练。
推荐理由:官方公告给出两款模型的参数、上下文长度与架构细节,读者可以据此评估部署门槛和与 transformers 的集成方式。
Hugging Face 团队宣布 Gradio 每月有超过 100 万开发者使用,并复盘五年增长经验。核心做法包括以 Gradio Blocks 等低层原语代替高层抽象(gr.Blocks 占 80% 用量)、用 share links 一行代码实现应用传播、聚焦机器学习 Web 应用这一细分场景、不设路线图只做快速迭代,以及让每个应用同时生成 API 端点以便本地部署或程序化调用。
Hugging Face 宣布把运营 3 年的 NLP 课程更新扩展为 LLM 课程, hf.co/learn 同步升级。已新增微调 LLM(第 11 章)和构建 Deepseek R1 类推理模型(第 12 章)等章节,并与 LlamaIndex、LangChain、Unsloth、Marimo、Maxime Labonne 合作。
TNG Technology Consulting 分享自托管 LLM 服务时的请求排队优化经验,指出单个"重度用户"大量请求会通过 vLLM 等推理引擎的 FIFO 队列阻塞其他用户。
OpenAI 宣布成立一个新委员会,在其打造全球资源最完备非营利组织的过程中提供洞察。OpenAI 本身已是非营利组织,并利用 AI 帮助人们解决难题,目标是把潜在的历史性财务资源与可放大人类智慧的技术结合起来。
OpenAI 推出 PaperBench,这是一个评估 AI 智能体复现前沿 AI 研究能力的 benchmark。
OpenAI 就英国版权咨询提交回应,提出有助于把英国打造成“欧洲 AI 之都”的亲创新政策建议。
OpenAI 宣布获得 400 亿美元新融资,投后估值 3000 亿美元。资金将用于推进 AI 研究、扩大算力基础设施,并为每周使用 ChatGPT 的 5 亿用户交付更强的工具。
推荐理由:官方宣布的融资规模与估值数字,可用于追踪 OpenAI 的算力扩张和研究投入走向。
Hugging Face 在从 AWS 迁向多云(Azure、GCP)后,选择 Infisical 替代 HashiCorp Vault 集中管理 secrets。
Hugging Face 宣布将 Intel Gaudi 硬件支持直接合入 Text Generation Inference(TGI)主代码库(PR #3091),取代此前维护的独立 fork,基于 TGI 多后端架构支持 Gaudi1/2/3 全系列硬件。
OpenAI 提出从基于意图的机器人转向主动式 AI 智能体的方向。这类智能体不再被动等待用户指令,而是能够主动采取行动。
DeepSeek-V3 更新版 0324 上架 Hugging Face Hub,架构与原版相同并改为 MIT 许可,重点改进指令遵循、代码与数学能力。官方基准显示 MMLU-Pro 75.9→81.2、AIME 39.6→59.4、LiveCodeBench 39.2→49.2,常与 GPT-4.5 相当、普遍强于 Claude-Sonnet-3.7。
推荐理由:原文汇总了基准对比、能力改进细节和多种本地部署路径,读者可据此评估是否在自己的工作流中替换旧版 V3。
OpenAI 表示正在主动调整安全策略,将全面的安全措施直接构建到其基础设施和模型中。
Hugging Face 发布 Sentence Transformers 训练和微调 reranker(Cross Encoder)模型的详细教程,覆盖数据集、损失函数、训练参数、评估器和 CrossEncoderTrainer 五个组件,并介绍 mine_hard_negatives 挖掘难负样本。
推荐理由:教程给出完整可复现的 reranker 微调配方和评测数据,读者可据此在自己领域训练出超过通用大模型的小型 reranker。
OpenAI 在 GPT-4o 中推出原生图像生成功能,提升了文字渲染和指令遵循能力,并推出 ChatGPT Images 2.5。
推荐理由:官方宣布 GPT-4o 原生支持图像生成,强调文字渲染和指令遵循能力提升,适合关注多模态生成的读者。
OpenAI 发表 GPT-4o 系统卡附录,介绍 4o 图像生成,称其比此前 DALL·E 3 系列能力显著更强。它能生成照片级真实输出,并支持以图像作为输入进行转换。
推荐理由:原文明确了 4o 图像生成相比 DALL·E 3 的能力跃升,读者可以据此判断它在生成与图像转换上的新定位。
Hebbia 推出基于 OpenAI 的深度研究智能体,可自动化金融和法律工作中 90% 的任务。该产品利用 AI 智能体处理相关工作流程,大幅减少人工操作。
OpenAI 宣布领导层调整,公司将继续专注于推动人类进步的前沿 AI 研究。目前 OpenAI 的产品已被数亿人使用,规模较此前显著增长。
Hugging Face 的 Gradio 更新了 gr.Dataframe 组件,过去 6 周关闭了 70 多个相关 issue。新功能包括多单元格选择、行号与 pinned_columns 列固定、复制与全屏按钮、static_columns 静态列,以及 show_search 参数提供的搜索和过滤功能,还改进了键盘导航等无障碍体验。