OpenAI 发布 Operator
OpenAI 宣布推出 Operator,原文链接为 https://openai.com/index/introducing-operator。材料正文抓取失败,仅标题可用,产品细节以原文为准。
OpenAI 宣布推出 Operator,原文链接为 https://openai.com/index/introducing-operator。材料正文抓取失败,仅标题可用,产品细节以原文为准。
OpenAI 发布 Operator 的 System Card,说明基于既有安全框架的多层防护方法。文档涵盖针对提示词注入和越狱的模型与产品层缓解措施、隐私与安全保护,以及外部红队测试、安全评估和后续持续完善安全措施的工作。
Hugging Face 与 NVIDIA 发布 KVPress 教程,介绍如何通过压缩 KV Cache 实现省内存的长上下文 LLM 推理。
Hugging Face 发布 SmolVLM 家族两款新模型 SmolVLM-256M 和 SmolVLM-500M,各含 base 与 instruct 共 4 个 checkpoint,其中 256M 为迄今最小的 VLM。
推荐理由:官方详述 256M/500M 两款小模型的视觉编码器、数据配比和 tokenization 改动,适合想在受限设备上跑多模态的读者参考选型。
总部位于德国的全球媒体、服务与教育公司贝塔斯曼(Bertelsmann)将在全球多个品牌中整合 OpenAI 的技术,借助其提升创作力与生产力。
OpenAI 发布研究,探讨通过增加推理时计算来提升模型对抗鲁棒性的方法。研究分析了更多推理计算与对抗攻击防御之间的关系。
Hugging Face 与 FriendliAI 达成合作,将 FriendliAI Endpoints 集成到 Hugging Face Hub 的“Deploy this model”按钮中,实现模型一键部署。
OpenAI 官方宣布启动 The Stargate Project。本次 feed 仅提供标题,正文细节未随原文给出。
OpenAI 与战略合作伙伴宣布共建 AGI 基础设施的共同愿景,公开征集数据中心基础设施产业链上的合作企业,范围覆盖电力、土地、建设和设备等环节。相关企业可通过官方表单与其建立联系。
Mistral AI 宣布与法新社(AFP)建立全球合作伙伴关系,其 AI 助手 Le Chat 将接入 AFP 的新闻电讯内容,使回复基于可靠、最新的信息。AFP 每天 6 种语言(法语、英语、西班牙语、葡萄牙语、德语、阿拉伯语)产出 2,300 条新闻稿,全球有 1,700 名记者。该集成将在未来几周内向所有 Le Chat 用户推出。
Hugging Face 为 Text Generation Inference(TGI)引入 TGI Backends 多后端架构,通过新的 Rust Backend trait 让 TGI 作为统一前端接入不同推理引擎。
Hugging Face 官方博客宣布 transformers 集成 TimmWrapper,让任意 timm 视觉模型可直接使用 pipeline、Auto Classes、Trainer API 和 LoRA 微调。
OpenAI 与 Axios 达成合作,延续其与新闻行业的合作策略。目前代表数百个新闻编辑室和内容品牌的出版商正通过 OpenAI 的合作与资助项目采用 AI 工具,ChatGPT 用户则可获取这些可靠出版物的信息。
Hugging Face 发布用 Sentence Transformers 训练静态嵌入模型的方法,新模型在 CPU 上比 all-mpnet-base-v2 等常见模型快 100 到 400 倍,同时保留至少 85% 的性能。
推荐理由:原文完整公开了静态嵌入模型的训练配方、脚本和数据集清单,并给出与主流模型的性能对比,可复用于低成本嵌入场景。
OpenAI 宣布 Adebayo Ogunlesi 加入其董事会。原文仅披露这一人事任命,未提供更多细节。
Mistral AI 发布 Codestral 25.01,采用更高效的架构和改进的 tokenizer,代码生成与补全速度提升约 2 倍,上下文长度达 256k。
Hugging Face 概述了 AI 智能体的定义,并分析了其伦理权衡。文章提出,智能体的风险随自主性水平上升:用户让渡的控制越多,安全、隐私等风险越大,并建议不要开发能编写和执行自身代码的完全自主智能体,而半自主智能体的收益可能大于风险。
LlamaIndex 与 Hugging Face 发布多语言视觉文档检索嵌入模型 vdr-2b-multi-v1 及英文版 vdr-2b-v1,可直接对文档页截图编码检索,无需 OCR、数据抽取管线或分块。
Hugging Face 基于 Open LLM Leaderboard 上 2,742 个模型的评测数据,分析了模型推理的 CO₂ 排放趋势。模型越大排放越高,但收益递减;Qwen-2.5-14B 和 Phi-3-Medium 的得分-排放比最优,MoE 排放偏高。社区微调模型普遍比官方微调更省碳,10B 以下社区模型可平均得分 35、排放低于 5kg CO₂。
Hugging Face 发布 smolagents,一个约几千行代码的极简智能体库,支持以代码形式编写动作的 CodeAgent,可通过 E2B 沙箱安全执行,并保留传统 JSON 调用的 ToolCallingAgent。
推荐理由:官方发布并给出代码示例与基准对比,读者可以了解用代码写动作的智能体库如何上手以及何时该用智能体。
OpenAI 官方发文说明组织架构必须演进以推进使命,提出方向是让非营利部分更强大,并由营利部分的成功提供支持。
Hugging Face 发布教程,讲解如何用 torch.cuda.memory 快照工具可视化 PyTorch 训练各阶段的 GPU 内存占用。文章以 Qwen/Qwen2.5-1.5B 训练循环为例拆解参数、优化器状态、激活、梯度和优化器中间值的内存构成,并给出总内存估算公式与激活数量的线性启发式。
推荐理由:原文用 PyTorch 内存快照工具拆解训练各阶段的显存构成,并给出可复用的总内存估算公式和启发式,便于读者定位显存瓶颈。
Hugging Face 博客介绍 NVIDIA 开源的 LogitsProcessorZoo,一组与 Transformers 的 generate 方法兼容的模块化 logits 处理器,通过直接修改输出概率分布来控制生成。
推荐理由:原文给出四个 logits 处理器的参数、代码和实际输出对比,读者可以直接照着控制生成长度、引用、结尾短语和选择题格式。
OpenAI 推出面向 o1 模型的新对齐策略 Deliberative alignment,直接教模型安全规范并让其对这些规范进行推理。该方法旨在通过推理能力提升语言模型的安全性。
推荐理由:OpenAI 官方介绍了 o1 系列采用的对齐策略思路,可作为理解推理能力如何用于安全规范的参考材料。
Artificial Analysis 发布音频语言模型推理评测集 Big Bench Audio,从 Big Bench Hard 四个类别各选 250 题生成 1000 道音频题,并给出 GPT-4o 与 Gemini 1.5 系列在语音到语音、语音到文本、文本到语音、文本到文本四种配置下的 18 组实验结果。
Answer.AI 与 LightOn 联合发布 ModernBERT 编码器模型系列,提供 base(149M 参数)和 large(395M 参数)两个规格,可作为 BERT 类模型的直接替代。
推荐理由:Answer.AI 与 LightOn 官方发布,作者本人阐述了架构与训练改动,读者可据此评估它能否替换现有 BERT 类工作流。
IBM、Princeton、CMU 和 UIUC 发布基于完全开放数据训练的混合 Mamba2 模型 Bamba-9B,在 vLLM 中相比标准 transformer 实现最高 2.5 倍吞吐提升和 2 倍延迟加速。
TII 发布 Falcon3 开源模型家族,包含 Falcon3-1B-Base、3B、7B、10B 和 Mamba-7B 五个基座模型,均低于 10B 参数。
Hugging Face 在 Google Cloud 两款 Xeon 实例上评测了 Agentic AI 的文本嵌入与文本生成两类负载。
OpenAI 推出 o1 模型,同时带来面向开发者的多项更新,包括 Realtime API 改进和一种新的微调方法。
推荐理由:官方公告集中列出 o1 模型、Realtime API 改进与新微调方法,开发者可据此了解当期可用的工具变化。
Hugging Face 发布 Synthetic Data Generator,一款无代码应用,通过三步流程(描述数据集、配置微调、生成推送)用 LLM 从自定义提示词生成数据集,底层由 distilabel 和免费 Hugging Face 文本生成 API 驱动。
推荐理由:官方介绍这款无代码合成数据工具的完整流程与可配置项,读者可据此判断能否用自然语言快速搭建数据集和模型。
OpenAI 发文回应 Elon Musk 最新的法律文件,指出这是他在不到一年内第四次重新包装诉讼主张。OpenAI 称,Musk 在 2017 年不仅希望、而且实际创建了一个营利性架构,作为 OpenAI 当时拟采用的新组织结构。
Entalpic 与 Hugging Face 联合发起开源协作项目 LeMaterial,旨在简化并加速材料研究、训练 ML 模型和探索化学空间。
OpenAI 宣布视频生成模型 Sora 上线,用户可在 sora.com 使用。支持生成最高 1080p、最长 20 秒的视频,可选宽屏、竖屏或方形比例,还可导入自有素材进行扩展、混剪与融合,或从文本生成全新内容。
推荐理由:官方公布视频生成的分辨率、时长与素材混用方式,读者可据此判断是否把 Sora 纳入现有视频创作流程。
电影人 Lyndon Barrois 讲述如何将 Sora 用作叙事工具,借助它进行创作并构建新的世界。
电影制作组合 Vallée Duhamel 分享了他们如何借助 OpenAI 的 Sora 创作影像、构建新世界。该内容以 OpenAI News 的形式发布了这对双人组对 Sora 辅助电影制作流程的说明与创作经验。
OpenAI 发布面向产品团队的 AI 应用内容,主张让 AI 融入产品团队的日常工作流程。
OpenAI 发布 Sora 视频生成模型的系统卡。Sora 接受文本、图像和视频输入并生成新视频,建立在 DALL-E 和 GPT 模型的经验之上,旨在为人们的叙事和创意表达提供更多工具。
推荐理由:官方系统卡说明了 Sora 的输入输出形式和模型来源,读者可以据此了解其能力定位。
Hugging Face 的热门开源模型现已可通过 Amazon Bedrock Marketplace 部署,共提供 83 个开源模型。
跨学科艺术家 Minne Atairu 分享她如何借助 OpenAI 的视频生成模型 Sora 实现自己的艺术创作愿景。她讲述了 Sora 在其创作过程中扮演的角色与带来的帮助。