OpenAI 发布 o1 与 o1-mini 系统卡,说明发布前安全评估工作
OpenAI 发布 o1 与 o1-mini 的系统卡,说明模型发布前完成的安全工作。内容涵盖外部红队测试,以及依据 Preparedness Framework 开展的前沿风险评估。
推荐理由:这是 OpenAI 官方对 o1 系列发布前安全工作的系统说明,涵盖外部红队测试和前沿风险评估框架的具体执行。
OpenAI 发布 o1 与 o1-mini 的系统卡,说明模型发布前完成的安全工作。内容涵盖外部红队测试,以及依据 Preparedness Framework 开展的前沿风险评估。
推荐理由:这是 OpenAI 官方对 o1 系列发布前安全工作的系统说明,涵盖外部红队测试和前沿风险评估框架的具体执行。
Hugging Face 博客作者搭建了一个 Keras chatbot arena,用 Gradio、Spaces、JAX 和 TPU 测试 LLM 在对话中被指出错误后能否自行修复。
Google 发布视觉语言模型 PaliGemma 2,将 SigLIP 图像编码器与 Gemma 2 语言模型结合,提供 3B、10B、28B 三种规模,支持 224x224、448x448 和 896x896 三种输入分辨率。
推荐理由:Google 发布 PaliGemma 2 视觉语言模型,提供 3B、10B、28B 三种规模与多分辨率选择,并附 transformers 集成和微调脚本。
OpenAI 与专业媒体平台 Future 宣布达成战略合作,将 Future 旗下 200 多个媒体品牌的内容带给 OpenAI 的用户。
Morgan Stanley 使用 AI evals 来塑造金融服务的未来。通过与 OpenAI 的合作,该公司将 AI 评测体系应用于金融服务场景,以评估和改进 AI 在实际业务中的表现。
Hugging Face 发布开源开发者 EU AI Act 合规指南,说明该法案适用于欧盟内受影响的开源 AI 系统和模型。
推荐理由:面向开源开发者的指南,把 AI Act 的风险分级拆成文档、水印、opt-out 等可操作步骤,并给出 Hugging Face 现成工具。
Hugging Face 发布 2B 小型视觉语言模型 SmolVLM,含 Base、Synthetic 和 Instruct 三个版本,模型、数据集、训练配方均以 Apache 2.0 开源。
推荐理由:原文给出与同级 2B 模型的显存、token 编码和吞吐对比数据,可帮助读者评估端侧部署小 VLM 的实际成本。
Hugging Face 博客以迭代推导方式讲解位置编码设计,从整数编码、二进制编码到正弦编码,最终推导出 Llama 3.2 等现代 Transformer 采用的 RoPE。
推荐理由:文章把 RoPE 的设计过程拆成可跟随的迭代推导,从整数编码一步步走到旋转矩阵,适合想理解位置编码原理的读者。
OpenAI 发布了关于结合人员与 AI 推进红队测试的内容,介绍了将人工与 AI 方法结合用于红队测试的方向。
OpenAI 展示如何通过 GPT-4o 的视觉微调能力构建更智能的地图。文章介绍了利用 GPT-4o vision fine-tuning 提升地图相关视觉任务效果的方法。
Hugging Face 与跨组织项目 LLM-jp 联合推出 Open Japanese LLM Leaderboard,用于集中评测和比较日语大语言模型。
BAAI 推出 FlagEval Debate「Debate Arena」平台,让大模型两两辩论比拼推理与语言能力,目前支持中文、英文、阿拉伯语和韩语四语种。平台采用专家评审加用户投票的双评估体系,并允许参赛团队微调模型参数与对话策略。相比 LMSYS Chatbot Arena 等静态或用户投票式评测,它能缓解区分度不足、模型各自独立生成和投票偏好偏差等问题。
Hugging Face 的 Xet 团队正用内容定义分块(CDC)替代 Git LFS 的文件级存储,只传输和保存修改过的 chunk,以提升 Hub 上 30 PB 模型、数据集与空间的存储效率。
Hugging Face 详解 LayerSkip 提出的 self-speculative decoding:用同一模型的浅层生成草稿 token、深层做验证,兼得加速、内存节省与更低延迟。
Rox 全面押注 OpenAI,将其商业经验与深度 LLM 专长和 OpenAI 模型相结合。该方案旨在让每一位销售人员都达到前 1% 销售精英的水平。
Hugging Face 与 Atla 推出 Judge Arena 平台,让用户对两个 LLM 评判模型在同一测试样本上的打分与理由进行投票,结果以 Elo 分数汇入每小时更新的公开排行榜。
Mistral AI 宣布对旗下免费 AI 助手 le Chat 进行重大更新,新增带引用的联网搜索、Canvas 创作界面、Agents 自动化工作流,并以免费 beta 形式提供。
推荐理由:官方公布 le Chat 一批免费 beta 功能及与 ChatGPT 等竞品的功能对比表,读者可以据此判断它作为替代方案的位置。
Mistral 发布 Pixtral Large,一个基于 Mistral Large 2 的 124B 开源权重多模态模型,在 MathVista 达到 69.4%,DocVQA 与 ChartQA 上超过 GPT-4o 和 Gemini-1.5 Pro,LMSys Vision Leaderboard 上领先最近的开放权重模型近 50 ELO。
推荐理由:官方给出关键基准数字和开放下载渠道,读者可以据此判断该多模态模型在图像理解和文本能力上的定位。
OpenAI 在法国设立办公室,这是其欧洲大陆的首个办公地点。此次布局标志着 OpenAI 在欧洲的业务拓展进一步落地。
雅诗兰黛集团(The Estée Lauder Companies)使用 ChatGPT Enterprise 和自定义 GPT 分析消费者数据、挖掘洞察,加速美妆产品创新。OpenAI 展示了该企业级应用在数据驱动美容与创意领域的实际落地方式。
Hugging Face Hub 提供数据集托管与分享服务,可承载 TB 级数据集,Xet 团队正将单文件上限从 50 GB 提升至 500 GB。平台内置 Dataset Viewer(支持全文搜索和排序)、SQL Console,并兼容 Pandas、Spark、DuckDB 等第三方库,多数库一行代码即可加载或流式读取数据集。
Mistral 在 La Plateforme 上推出 Batch API,用于高吞吐量批量请求,价格比同步 API 调用低 50%。用户上传批处理文件,处理完成后下载输出文件即可,适用于情感分析、批量文档摘要与翻译、向量嵌入和数据标注等场景。该 API 支持平台上所有模型,每个工作区限 100 万个进行中请求,即将登陆云服务商伙伴平台。
Mistral AI 发布内容审核 API,与 Le Chat 的审核服务使用同一 API。该模型是基于 LLM 的分类器,可将文本输入分为 9 个类别,提供原始文本和对话内容两个端点,原生支持阿拉伯语、中文、英语、法语等 11 种语言。API 可帮助用户针对具体应用场景定制安全标准,政策类别涵盖不合格建议和 PII 等模型生成危害。
Hugging Face 发布 PyCharm 集成功能,开发者可在 IDE 内右键插入 HF 模型并自动获取示例代码。文章演示了用 microsoft/Phi-3.5-vision-instruct 十分钟内搭建图文对话应用,并介绍了悬停即显模型卡、本地模型缓存查看与清理等功能。该集成为 PyCharm Professional 专属,可用 PyCharm4HF 兑换 3 个月免费订阅。
Argilla 推出 2.4 新功能,无需写代码即可从 Hugging Face Hub 导入数据集并收集人工反馈。在 Argilla UI 中点击导入按钮即可开始,系统会根据数据集特征自动生成初始配置,可添加标签、评分、排序等问题;当前仅支持公开数据集,私有数据集支持尚未提供。该功能降低了领域专家参与数据集建设的门槛,部署推荐使用 Spaces 并默认启用 Hugging Face OAuth。
OpenAI 发布 ChatGPT search,可为用户提供快速、及时的答案,并附上相关网页来源链接。
推荐理由:OpenAI 官方宣布 ChatGPT 支持联网搜索并附来源链接,读者可据此了解其获取及时信息的新方式。
Promega 自上而下在全公司采用 ChatGPT,加快了制造、销售和营销环节的工作效率。
OpenAI 推出事实性基准 SimpleQA,用于衡量语言模型回答简短事实性问题的能力。
Decagon 与 OpenAI 合作,在大规模场景下提供高性能、完全自动化的客户支持服务。
Intel Labs 与 Hugging Face 推出 Universal Assisted Generation(UAG),通过双向 tokenizer 翻译让辅助生成不再要求目标模型与助手模型共享同一 tokenizer,可将任意 decoder 或 MoE 模型的推理加速 1.5x-2.0x 且几乎零开销。
推荐理由:原文解释了跨 tokenizer 助手模型的实现原理并给出多组加速数据,还提供 Transformers 4.46.0 的可用代码。
Digital Green 与 Hugging Face Expert Support 合作,为面向小农户的农业问答机器人 Farmer.chat 搭建了 LLM-as-a-judge 评测体系,覆盖提示词清晰度、问题类型、回答率和 RAG 准确性等指标,LLM 评分与约 360 题的人工评估高度相关。
Cohere For AI 发布 Aya Expanse 8B 和 32B 开源权重模型。在 Arena-Hard-Auto 23 语言成对对比中,Aya Expanse 32B 胜过 Gemma 2 27B。
OpenAI 发布论文,对连续时间一致性模型做了简化、稳定化和规模化,仅用两个采样步骤即可达到与领先扩散模型相当的样本质量。
Hugging Face 发布 HUGS(Hugging Face Generative AI Services),为在自有基础设施中部署开源模型提供零配置的优化推理微服务。
Google DeepMind 与 Hugging Face 在 Transformers v4.46.0 中发布 SynthID Text,可通过 g-function 与 tournament sampling 为任意 LLM 的 model.generate() 输出添加人眼不可见的水印。
推荐理由:原文给出水印的实现方式、配置参数与检测训练流程,开发者可以据此把 SynthID Text 接入现有生成调用。
Hugging Face 等团队发布长视频问答数据集 CinePile 2.0,核心改进来自其提出的对抗式数据精炼方法。初代 CinePile 于 2024 年 5 月上线,含约 300,000 训练样本和 5,000 测试样本,人类成绩曾领先最佳商业视觉模型 25%、开源模型 65%。
OpenAI 与 Lenfest Institute 合作推出 AI Collaborative and Fellowship 项目。目前公开信息有限,仅见 OpenAI News 发布的这一合作项目公告,具体内容、参与方式与资助细节尚未展开。
dottxt 与 Hugging Face 合作推出 outlines-core 0.1.0,将 Outlines 结构化生成核心算法移植到 Rust 并提供 Python 绑定。索引编译速度平均提升 2x,且通过 Rust 提前编译消除了此前 Numba JIT 带来的首次运行延迟。该库轻量、关注点分离,未来可绑定到 Python 之外的语言,方便更多库集成结构化生成。
Hugging Face 的 Speech-to-Speech(S2S)项目通过 VAD、STT、语言模型和 TTS 组成的级联 pipeline 实现语音对话,支持英、法、西、中、日、韩六种语言及自动语言检测。
Hugging Face 发布 Transformers.js v3,经一年多开发后正式推出,WebGPU 加速可比 WASM 快至 100 倍,支持架构总数达 120 个,Hub 上预转换模型超过 1200 个。
推荐理由:官方发布说明给出 WebGPU 加速、量化选项和迁移方式,读者可以据此评估是否升级到 v3。