OpenAI DevDay 发布 GPT-4 Turbo、Assistants API 等新产品
OpenAI 在 DevDay 发布 GPT-4 Turbo,支持 128K 上下文且价格更低,同时推出 Assistants API。GPT-4 Turbo with Vision、DALL·E 3 API 等更多开发者产品一同公布。
推荐理由:官方一次性给出 128K 上下文、降价与多个 API 开放入口,读者可以据此评估是否迁移现有调用与工作流。
OpenAI 在 DevDay 发布 GPT-4 Turbo,支持 128K 上下文且价格更低,同时推出 Assistants API。GPT-4 Turbo with Vision、DALL·E 3 API 等更多开发者产品一同公布。
推荐理由:官方一次性给出 128K 上下文、降价与多个 API 开放入口,读者可以据此评估是否迁移现有调用与工作流。
Hugging Face 在 Enterprise Hub 计划中推出 Storage Regions,让组织决定模型和数据集的存储位置,目前支持 US 和 EU 两个区域,Asia-Pacific 即将推出。
Hugging Face 发布教程,介绍如何用 Hugging Face GitHub 公共仓库代码微调 bigcode/starcoder (15.5B) 等模型,打造个人编程助手 HugCoder。
推荐理由:原文完整给出从数据采集到部署的微调流程,并附 QLoRA 与全量微调的成本和评测对比,方法可迁移到自有代码库。
OpenAI 宣布推进针对高能力 AI 系统的灾难性风险防范工作,将组建 Preparedness 团队并发起一项挑战赛,以支持前沿 AI 安全。
OpenAI 与 Anthropic、Google、Microsoft 共同宣布 Frontier Model Forum 的新任执行董事人选,并设立 1000 万美元的 AI 安全基金(AI Safety Fund)。该基金旨在支持 AI 安全领域相关工作,是四大公司推动前沿模型安全治理的最新举措。
Hugging Face 官方博客介绍如何用一行 spotlight.show(ds) 代码,通过 Renumics Spotlight 交互式可视化 datasets 库中的数据集,无需复制或预处理数据。
Hugging Face 发布技术博客,复现 OpenAI 2019 年 RLHF 代码库 openai/lm-human-preferences,在情感和描述性等风格任务上匹配了原始学习曲线,并整理出实现细节清单。
Hugging Face Diffusers 团队发文讲解如何优化 SDXL 的推理速度和内存占用,测试在 A100(40GB)上进行,每轮生成 4 张图取第 3 次结果。
推荐理由:官方在 A100 上实测了多种 SDXL 推理优化手段并附完整数据表,读者可以按自己的显存和延迟需求直接选用对应技巧。
Hugging Face 展示如何通过 Inference Endpoints 与 Text Embeddings Inference(TEI)部署开源嵌入模型,用于 RAG 等检索增强场景。
OpenAI 宣布 DALL·E 3 现已在 ChatGPT Plus 和 Enterprise 中可用。官方为此开发了安全缓解措施栈以支持更广泛的发布,并同步分享了其内容溯源研究的进展。
推荐理由:官方宣布 DALL·E 3 开放范围扩大,并提及安全缓解措施与溯源研究,读者可了解其上线入口与安全准备。
Hugging Face 推出 @gradio/lite,通过 Pyodide 让 Gradio 应用直接在浏览器中运行,无需服务器端基础设施。开发者在 HTML 中引入 JS/CSS 并在 <gradio-lite> 标签内写 Python 代码即可,支持 <gradio-file> 多文件和 <gradio-requirements> 通过 micropip 安装依赖。
推荐理由:原文给出完整的上手代码和依赖、加载时间等限制说明,读者可直接照做评估浏览器端部署是否适合自己。
Ironclad 采用 GPT-4 简化合同审查流程。借助 GPT-4,Ironclad 让合同审查变得更加高效便捷。
Retool 使用 GPT-4 为企业提供快速、安全地构建 AI 应用的方式。该方案帮助企业在业务场景中打造 AI 驱动的应用。
Typeform 利用 OpenAI 的 GPT-3.5 和 GPT-4,把在线表单升级为动态、对话式的数据收集体验。这一能力使表单收集更接近自然对话,提升用户填写体验。
Hugging Face 上超过 130,000 个支持 ONNX 的模型可借助 ONNX Runtime 加速,包括 BERT、GPT2、Whisper 等多种 LLM 和云模型。
Hugging Face 宣布 tokenizers 新增 chat_template 属性,用于保存模型训练时的对话格式,避免因格式不匹配导致难以察觉的性能严重下降。
推荐理由:原文指出对话格式不匹配会导致静默性能下降,并给出将 Jinja 聊天模板随 tokenizer 保存和使用的具体做法。
Hugging Face 宣布 Diffusers 现已支持通过 JAX 在 Cloud TPU 上部署 Stable Diffusion XL(SDXL),实现高性能、低成本的推理。
Hugging Face 发布教程,介绍如何 fork 并配置 AI Comic Factory,通过 Inference API 部署到自己的私有 Space,避免长时间排队。
Hugging Face 介绍了如何通过 TRL 库新增的 DDPOTrainer,用强化学习方法 DDPO 微调 Stable Diffusion,使输出更符合人类审美。
Hugging Face 伦理与社会团队发布夏季通讯,披露其 CEO Clem 在美国国会作证、出席美国参议院 AI Insight Forum,并对 E.U. AI Act 和 NTIA 的 AI 问责议题提出意见。
Hugging Face 发布面向非工程师的教程,用 Spaces、AutoTrain 和 ChatUI 三个工具,无需写代码即可微调 Llama 2 并部署聊天应用。教程分三步:创建 AutoTrain Space、用 Alpaca 指令数据集微调模型(示例用 7b 基座模型)、再用 ChatUI 模板部署成可分享的聊天应用。
Mistral AI 发布 7.3B 参数开源模型 Mistral 7B,采用 Apache 2.0 许可证,在所有基准上超越 Llama 2 13B,并在多数基准上优于 Llama 1 34B。
推荐理由:官方给出与 Llama 2 全面对比的评测数据和架构改进细节,读者可据此评估 7B 级开源模型的性价比与部署选择。
Mistral AI 发布首个模型 Mistral 7B,在标准英文和代码基准上超越所有现有 13B 参数以下的开放模型,权重以 Apache 2.0 许可开放。官方称 MMLU 上超过 60% 的最小模型在两年内从 280B 的 Gopher 缩小到 7B,并同步开设 GitHub 仓库和 Discord 频道推进社区协作。
推荐理由:官方阐述开源模型路线并给出 MMLU 演进脉络,读者可借此理解 7B 小模型与专有模型的差距变化。
Hugging Face 发布了一项针对 Llama 2 在 Amazon SageMaker 上部署的基准测试,分析了 60 种不同部署配置。测试覆盖 7B、13B、70B 三种参数规模,在 g5 与 p4d 系列 EC2 实例上,以 1/5/10/20 并发请求,比较有无 GPTQ 4-bit 量化的延迟与吞吐。
OpenAI 发布 GPT-4V(ision) 系统卡,说明其图像输入能力及相关评估情况。抓取内容仅含标题,正文细节不可得。
OpenAI 官方宣布 ChatGPT 新增多模态能力,可以看图、听声音并进行语音对话。正文未能抓取,仅标题信息可用,具体功能细节以原文链接为准。
Hugging Face 推出 Inference for PROs,为 PRO 订阅用户提供精选模型的高速推理 API 端点和更高的免费 Inference API 速率限制。
OpenAI 宣布成立 OpenAI Red Teaming Network,并发出公开招募,邀请领域专家加入,帮助改进 OpenAI 模型的安全性。
个人理财应用 Rocket Money 用 BERT 系列模型替代维护成本高的 regex 系统,为 4000+ 类别的交易文本分类提供支持,其原有 regex 系统每月处理超 1 亿笔交易。在对比自建方案、AWS Sagemaker 和 Hugging Face Inference API 后,经三个月评估选择 Hugging Face 托管模型,一周内即承接部分流量并通过最坏情况负载测试。
3D Gaussian Splatting 是一种光栅化技术,源自论文 "3D Gaussian Splatting for Real-Time Radiance Field Rendering",可从少量图像实时渲染照片级真实感场景。
Hugging Face 推出 Object Detection Leaderboard,对 Hub 上的目标检测模型按指标排名。文章讲解了 IoU、AP、AR 等指标的计算方法,并指出评测中可能导致不同报告结果不一致的偏差与陷阱。开发者可据此在数百个开源模型中挑选最适合自身应用的目标检测模型。
Hugging Face 官方博客系统讲解 LLM 推理优化的三类技术:8-bit/4-bit 量化、Flash Attention 注意力算法,以及 RoPE、ALiBi、MQA、GQA 等架构改进。
推荐理由:Hugging Face 官方以实测代码系统讲解量化、Flash Attention 与模型架构三类 LLM 推理优化方法,可迁移到部署实践。
OpenAI 宣布在爱尔兰都柏林设立办公室,以扩大其在欧洲的业务布局。
Hugging Face 发布 Würstchen,一种在高度压缩潜空间中工作的文生图扩散模型,实现 42x 空间压缩。生成速度明显快于 SDXL 且内存占用更低;Würstchen v2 训练用 24,602 GPU 小时,支持最高 1536 分辨率,已集成进 Diffusers,模型权重和 Demo 已在 Hub 上线。
推荐理由:42x 空间压缩带来的训练与推理成本对比有具体数字,适合想低成本跑文生图的读者参考。
Hugging Face 团队发布教程,讲解如何用 PyTorch FSDP 在 2 节点共 16 张 A100 80GB 上全参数微调 meta-llama/Llama-2-70b-chat-hf,训练耗时约 13.5 小时。
Hugging Face 官方博客概述 Transformers 原生支持的 bitsandbytes 与 auto-gptq 两种量化方案的优缺点,并附基准测试。
Hugging Face 推出企业级代码助手 SafeCoder,基于 BigCode 项目开源的 StarCoder 模型(15.5B 参数、80+ 编程语言、8192-token 上下文窗口),训练数据为 The Stack 中 1 trillion 代码 token。
Hugging Face Diffusers 团队与 T2I-Adapter 作者合作,为 Stable Diffusion XL 推出 T2I-Adapter 支持,并发布 sketch、canny、lineart、depth、openpose 五种条件的 checkpoints。
推荐理由:原文给出 T2I-Adapter-SDXL 与 ControlNet 的参数量对比、训练配置和完整用法代码,读者可以据此评估并直接上手使用。
OpenAI 将于 11 月 6 日在旧金山举办其首届开发者大会,主题演讲将提供全球直播。线下参会的开发者报名将在未来几周内开放。
TII 发布 Falcon 180B,为当时最大的开放语言模型,拥有 1800 亿参数,使用 RefinedWeb 数据集在 3.5 万亿 token 上完成预训练。
推荐理由:原文给出了参数量、训练规模、评测对比和完整部署硬件门槛,读者可以据此评估是否在自己的场景中采用这个开源模型。