OpenAI 深入复盘 GPT-4o 讨好性问题并公布后续改进
OpenAI 发布文章,进一步说明模型讨好性(sycophancy)问题的发现、出错原因以及将做出的未来改进。当前 feed 仅提供摘要,完整分析细节需查看原文 https://openai.com/index/expanding-on-sycophancy。
OpenAI 发布文章,进一步说明模型讨好性(sycophancy)问题的发现、出错原因以及将做出的未来改进。当前 feed 仅提供摘要,完整分析细节需查看原文 https://openai.com/index/expanding-on-sycophancy。
Hugging Face 博客对比 Qwen-3 与 Qwen-2.5、QwQ 的 Jinja chat template,总结出四点设计差异:Qwen-3 通过 enable_thinking 标志配合空 <think></think> 让推理变为可选项,而 QwQ 强制每次推理。
Hugging Face 官方博客介绍如何用 Gradio 将 Python 函数构建为 MCP 服务器,只需安装 gradio[mcp] 并在 .launch() 中设置 mcp_server=True,即可让 LLM 通过 Claude Desktop、Cursor、Cline 等 MCP Client 调用该应用作为工具。
推荐理由:官方教程演示只需在 launch 中设 mcp_server=True 即可把任意 Gradio 应用变成 MCP server,含资源和鉴权等进阶用法。
OpenAI 已回滚上周 ChatGPT 中的 GPT-4o 更新,用户现改用行为更均衡的早期版本。被移除的更新表现得过度讨好或附和,常被称为谄媚(sycophancy)。
推荐理由:官方说明回退原因与现状,读者可以了解 ChatGPT 模型行为问题的处理方式。
Intel 推出 AutoRound,一种 weight-only 后训练量化方法,通过符号梯度下降联合优化权重取整和截断范围,支持 INT2 至 INT8 低比特量化。
Hugging Face 开源 PipelineRL,这是一种实验性 LLM 强化学习实现,核心创新是在训练过程中进行 inflight 权重更新,在不停止推理的情况下同步最新模型权重,兼顾高推理吞吐与 on-policy 数据。
Hugging Face 发布 Tiny Agents 教程,展示在 InferenceClient 之上实现 MCP 客户端后,Agent 本质上只是一个 while 循环,全部代码约 50 行 TypeScript。
推荐理由:作者把 MCP 客户端到 Agent 的实现压缩成约 50 行 TypeScript,并提供可运行的开源代码,适合想理解 Agent 与 MCP 基本结构的开发者直接上手。
OpenAI 展示 ChatGPT for Business 的最新实机演示,涵盖 o3、图像生成、增强记忆和企业内部知识功能。视频逐一演示这些新能力在业务场景中的使用方式。
OpenAI 宣布最新图像生成模型通过 API 中的 gpt-image-1 提供,面向开发者和企业开放。开发者可将专业级、可定制的视觉生成能力直接集成到自己的工具和平台中。
推荐理由:官方宣布 gpt-image-1 进入 API,开发者可以把专业级、可定制的图像生成直接接入自己的工具和平台。
TNG 基于 olmOCR-7B-0225-preview 微调出一款忠实 OCR 引擎,解决原模型忽略页眉页脚信息的问题,已开源到 HuggingFace。团队用 Qwen2.5-VL-72B-Instruct 生成了 8000 份文档的数据集,在 8xH100 节点上训练 2.5 epochs,默认超参数即可取得良好效果。
OpenAI 发布了对语言学习应用 Speak CEO 兼联合创始人 Connor Zwick 的对话,介绍 Speak 如何用 AI 实现个性化语言学习。
The Washington Post 与 OpenAI 达成合作,将其新闻整合进 ChatGPT。用户在 ChatGPT 中可获得新闻摘要、引文以及指向原始报道的直接链接。
TNG 在 Hugging Face 博客发布 LLM 性能系列第二篇,讲解 prefill 与 decode 两个阶段对延迟、吞吐和 GPU 利用率的影响,并比较 static batching、continuous batching 和 prefill-first 等并发策略。
OpenAI 发布 o3 和 o4-mini 两款新模型,称其为迄今最智能、能力最强的模型,并支持完整的工具调用。
推荐理由:官方宣布 o3 与 o4-mini 两款新模型,主打更强能力与完整工具调用,想了解 OpenAI 推理模型最新进展可由此入手。
OpenAI 发布 o3 与 o4-mini 系统卡,两款模型结合了先进推理能力与完整工具能力。工具能力涵盖网页浏览、Python、图像与文件分析、图像生成、canvas、automations、文件搜索和 memory。
推荐理由:官方说明 o3 与 o4-mini 同时具备推理和完整工具调用能力,读者可据此了解这两个新模型的能力范围。
Princeton 团队推出长上下文语言模型评测基准 HELMET,已入选 ICLR 2025,共评测 59 个模型,发现合成任务(如 NIAH)与真实下游表现相关性差,前沿长上下文模型在复杂任务上仍受限。
Hugging Face 官方博客发文《17 Reasons Why Gradio Isn't Just Another UI Library》,称 Gradio 不只是 Python UI 库,而是可通过 UI 和 API 与机器学习模型交互的框架。
Cohere 正式成为 Hugging Face Hub 支持的 Inference Provider,也是首个在 Hub 上直接分享并提供模型推理的模型创建方。
OpenAI 宣布任命 4 位新顾问,为其公益慈善工作提供咨询支持。这些顾问将帮助指导 OpenAI 的非营利相关举措。
OpenAI 发布了更新版 Preparedness Framework,用于衡量和防范前沿 AI 能力可能带来的严重危害。该框架旨在评估前沿模型的风险并采取相应防护措施。
OpenAI 在 API 中发布 GPT-4.1 系列模型,在编码、指令遵循和长上下文理解方面有显著提升,同时发布其首个 nano 模型,即日起面向全球开发者开放。
推荐理由:官方宣布 GPT-4.1 系列上线 API,编码、指令遵循与长上下文能力全面提升,还推出了首个 nano 模型。
Hugging Face 宣布收购开源机器人公司 Pollen Robotics,这是其第五次收购,将开售旗舰人形机器人 Reachy 2,售价 $70,000,已用于 Cornell 和 Carnegie Mellon 等实验室。
推荐理由:官方宣布收购开源机器人公司并开放 Reachy 2 订购,读者可据此了解 Hugging Face 从软件平台走向机器人硬件的路线。
Protect AI 与 Hugging Face 自 2024 年 10 月合作以来,截至 2025 年 4 月 1 日已扫描 Hub 上 141 万个仓库中的 447 万个模型版本,累计在 51,700 个模型中发现 352,000 个不安全或可疑问题。
巴塞罗那超级计算中心语言技术实验室发布 Visual Salamandra,基于 Salamandra Instructed 7B,集成 SigLIP-So400m 视觉编码器、2 层 MLP 投影层和 late-fusion 技术,可处理单图、多图、视频和纯文本输入。
OpenAI 发布了 BrowseComp,一个用于评估浏览智能体(browsing agents)的基准测试。该基准旨在衡量智能体执行网页浏览任务的能力。
Mistral 介绍用“LLM As A Judge”评估 RAG 系统的方法,即由一个 judge LLM 按 1-10、True/False 或定性等级为 generator LLM 的回答打分。
Cloudflare 与 Hugging Face 达成合作,FastRTC 开发者只需 Hugging Face token 即可使用企业级 WebRTC 基础设施。持有有效 token 的开发者每月可免费传输 10GB 数据,无需信用卡;集成从 FastRTC 0.0.20 起可用,Cloudflare 的 TURN 服务器网络覆盖全球 335 个以上地点。
Inception 联合 MBZUAI 在 Hugging Face 推出 Arabic-Leaderboards Space,整合阿拉伯语 AI 评测,目前包含 AraGen-03-25 和基于 Arabic IFEval 的指令遵循榜单。
OpenAI 与 Canva 联合创始人兼首席产品官 Cameron Adams 展开对谈,探讨 Canva 如何借助 AI 激发用户创造力。
OpenAI 发布 EU Economic Blueprint,提出一系列政策建议,旨在帮助欧洲把握人工智能机遇,推动区域可持续经济增长。该蓝图强调 AI 应"由欧洲开发、在欧洲部署、为欧洲服务"。
Meta 发布 Llama 4 Maverick(约 400B、128 专家)和 Scout(约 109B、16 专家),均为 17B 激活参数的 MoE 原生多模态模型,在最多 40 万亿 token、200 种语言数据上训练。
推荐理由:官方公告给出两款模型的参数、上下文长度与架构细节,读者可以据此评估部署门槛和与 transformers 的集成方式。
Hugging Face 团队宣布 Gradio 每月有超过 100 万开发者使用,并复盘五年增长经验。核心做法包括以 Gradio Blocks 等低层原语代替高层抽象(gr.Blocks 占 80% 用量)、用 share links 一行代码实现应用传播、聚焦机器学习 Web 应用这一细分场景、不设路线图只做快速迭代,以及让每个应用同时生成 API 端点以便本地部署或程序化调用。
Hugging Face 宣布把运营 3 年的 NLP 课程更新扩展为 LLM 课程, hf.co/learn 同步升级。已新增微调 LLM(第 11 章)和构建 Deepseek R1 类推理模型(第 12 章)等章节,并与 LlamaIndex、LangChain、Unsloth、Marimo、Maxime Labonne 合作。
TNG Technology Consulting 分享自托管 LLM 服务时的请求排队优化经验,指出单个"重度用户"大量请求会通过 vLLM 等推理引擎的 FIFO 队列阻塞其他用户。
OpenAI 宣布成立一个新委员会,在其打造全球资源最完备非营利组织的过程中提供洞察。OpenAI 本身已是非营利组织,并利用 AI 帮助人们解决难题,目标是把潜在的历史性财务资源与可放大人类智慧的技术结合起来。
OpenAI 推出 PaperBench,这是一个评估 AI 智能体复现前沿 AI 研究能力的 benchmark。
OpenAI 就英国版权咨询提交回应,提出有助于把英国打造成“欧洲 AI 之都”的亲创新政策建议。
OpenAI 宣布获得 400 亿美元新融资,投后估值 3000 亿美元。资金将用于推进 AI 研究、扩大算力基础设施,并为每周使用 ChatGPT 的 5 亿用户交付更强的工具。
推荐理由:官方宣布的融资规模与估值数字,可用于追踪 OpenAI 的算力扩张和研究投入走向。
Hugging Face 在从 AWS 迁向多云(Azure、GCP)后,选择 Infisical 替代 HashiCorp Vault 集中管理 secrets。
Hugging Face 宣布将 Intel Gaudi 硬件支持直接合入 Text Generation Inference(TGI)主代码库(PR #3091),取代此前维护的独立 fork,基于 TGI 多后端架构支持 Gaudi1/2/3 全系列硬件。