Morgan Stanley 用 AI 评测(evals)塑造金融服务的未来
Morgan Stanley 使用 AI evals 来塑造金融服务的未来。通过与 OpenAI 的合作,该公司将 AI 评测体系应用于金融服务场景,以评估和改进 AI 在实际业务中的表现。
Morgan Stanley 使用 AI evals 来塑造金融服务的未来。通过与 OpenAI 的合作,该公司将 AI 评测体系应用于金融服务场景,以评估和改进 AI 在实际业务中的表现。
Hugging Face Xet 团队正在重新设计 Hub 的上传与下载架构,在内容分发第一站插入内容寻址存储(CAS),采用“dumb reads and smart writes”理念在字节级处理文件。
Hugging Face 的 Xet 团队正用内容定义分块(CDC)替代 Git LFS 的文件级存储,只传输和保存修改过的 chunk,以提升 Hub 上 30 PB 模型、数据集与空间的存储效率。
Hugging Face 详解 LayerSkip 提出的 self-speculative decoding:用同一模型的浅层生成草稿 token、深层做验证,兼得加速、内存节省与更低延迟。
Mistral AI 发布内容审核 API,与 Le Chat 的审核服务使用同一 API。该模型是基于 LLM 的分类器,可将文本输入分为 9 个类别,提供原始文本和对话内容两个端点,原生支持阿拉伯语、中文、英语、法语等 11 种语言。API 可帮助用户针对具体应用场景定制安全标准,政策类别涵盖不合格建议和 PII 等模型生成危害。
Intel Labs 与 Hugging Face 推出 Universal Assisted Generation(UAG),通过双向 tokenizer 翻译让辅助生成不再要求目标模型与助手模型共享同一 tokenizer,可将任意 decoder 或 MoE 模型的推理加速 1.5x-2.0x 且几乎零开销。
推荐理由:原文解释了跨 tokenizer 助手模型的实现原理并给出多组加速数据,还提供 Transformers 4.46.0 的可用代码。
Hugging Face 发布 HUGS(Hugging Face Generative AI Services),为在自有基础设施中部署开源模型提供零配置的优化推理微服务。
dottxt 与 Hugging Face 合作推出 outlines-core 0.1.0,将 Outlines 结构化生成核心算法移植到 Rust 并提供 Python 绑定。索引编译速度平均提升 2x,且通过 Rust 提前编译消除了此前 Numba JIT 带来的首次运行延迟。该库轻量、关注点分离,未来可绑定到 Python 之外的语言,方便更多库集成结构化生成。
Hugging Face 的 Speech-to-Speech(S2S)项目通过 VAD、STT、语言模型和 TTS 组成的级联 pipeline 实现语音对话,支持英、法、西、中、日、韩六种语言及自动语言检测。
Llama 3.2 两周前登陆 Hugging Face/Transformers,而 Keras 从第一天起就支持它,可直接从 safetensors 格式的 Hugging Face checkpoint 加载,如 "hf://meta-llama/Llama-3.2-1B-Instruct"。
Mistral AI 在 Mistral 7B 发布一周年之际推出端侧模型 Ministral 3B 和 Ministral 8B,主打设备端与边缘场景,官方称两者在 sub-10B 级别的知识、常识、推理、function-calling 和效率上达到新水平。
推荐理由:官方公布了两个端侧模型的能力定位、上下文长度、API 定价与权重许可,读者可据此评估本地推理场景的选型。
Hugging Face 委托 Trail of Bits 对 Gradio 5 进行独立安全审计,发现的漏洞已在 Gradio 5.0 发布前全部修复,完整报告已公开。
AMD 发布基于 Zen5 架构的第 5 代服务器级 EPYC CPU(代号 Turin),核心数最高达 192 核 384 线程。Hugging Face 与 AMD 合作验证了该平台上 LLM 与 RAG 场景的支持,并通过 AMD ZenDNN PyTorch 插件(zentorch)配合 torch.compile 加速推理。
Hugging Face 宣布 Gradio 5 稳定版发布,目标是让开发者用几行 Python 构建可上生产的机器学习 Web 应用。
推荐理由:官方宣布 Gradio 5 稳定版,列出性能、UI、流式与安全等具体改动和升级命令,开发者可据此评估迁移与使用。
Intel labs 与 Hugging Face 提出动态推测解码,通过基于草稿模型置信度阈值动态调整每轮推测 lookahead,文本生成最高加速 2.7x,并从 Transformers 4.45.0 起成为辅助生成的默认模式。
Mercado Libre 推出 AI 开发平台 Verdi,由 GPT-4o 驱动。该平台面向开发者提供基于 GPT-4o 的能力支持。
Hugging Face 指导如何用 Optimum-Intel 和 OpenVINO GenAI 优化并部署 Transformers 模型,以 meta-llama/Meta-Llama-3.1-8B 为例,通过 NNCF 进行 INT8/INT4 weight-only 量化(如 AWQ、scale estimation、混合精度)。
Hugging Face 发布把 Llama3 8B 微调到 BitNet 1.58 比特(三元权重 -1/0/1)的方法,模型在 HF1BitLLM 组织开源,其中两个在 10B tokens 上训练、一个在 100B tokens 上训练,MMLU 成绩超过 Llama 1 7B。
Hugging Face 发布 Accelerate 1.0.0 的首个候选版本,该库在三年半间从简化 PyTorch 多 GPU/TPU 训练的工具,成长为 transformers、diffusers、peft、trl 等包的基础。
Hugging Face 官方博客盘点 Hub 上五个常被忽视的工具:ZeroGPU(免费 A100 GPU,每工作负载 40GB vRAM)、多进程 Docker Space(用 supervisord)、Gradio API、Webhooks 和 Nomic Atlas 语义搜索。
推荐理由:作者用免费语义搜索项目实际串起 ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas 的用法,附可直接复用的代码示例。
Hugging Face 通过新 PR 和 DataCollatorWithFlattening 使无填充打包的指令微调训练兼容 Flash Attention 2,TRL 的 SFTTrainer 也可通过 padding_free=True 使用。
这篇 Hugging Face 教程讲解如何在 Google Cloud A3 节点(8 x H100)上,用 TGI 的 Deep Learning Containers 在 Vertex AI 上部署 Meta Llama 3.1 405B 的 FP8 量化版 Meta-Llama-3.1-405B-Instruct-FP8。
Hugging Face 发布 ggml 入门教程,介绍这个专注于 Transformer 推理的 C/C++ 开源机器学习库。教程讲解 ggml_context、ggml_cgraph、ggml_backend 等核心概念,给出在 Ubuntu 上编译运行矩阵乘法示例的完整步骤,并演示了使用 backend、打印计算图和导出 graphviz 格式的方法。
Hugging Face 官方宣布收购总部位于西雅图的 XetHub,团队来自曾在 Apple 构建内部 ML 基础设施的 Yucheng Low、Ajit Banerjee 和 Rajat Arya。
推荐理由:收购方官方说明整合路径,给出了 Git LFS 换自研存储后对大文件更新方式的具体改变和当前 Hub 规模数据。
Hugging Face 盘点截至 2024 年 8 月 6 日 Hub 上的主要安全功能。所有用户可用细粒度 token、双因素认证(2FA)、GPG commit signing、组织级访问控制,以及自动安全扫描流水线(ClamAV 恶意软件扫描、picklescan 扫描 pickle 文件、trufflehog 扫描密钥)。
Hugging Face 发布教程,介绍如何用 Quanto 对 Diffusers 中的 Transformer 扩散管线(PixArt-Sigma、Stable Diffusion 3、Aura Flow)做 FP8/INT8/INT4 量化以降低显存占用。
Hugging Face 推出 NVIDIA NIM API (serverless) 推理服务,面向 Enterprise Hub 组织,基于 NVIDIA DGX Cloud 的 H100 GPU 按请求计算时间计费,价格为 $8.25/小时(约 $0.0023/秒)。
Meta 发布 Llama 3.1 系列,在 Hugging Face Hub 上线 8B、70B、405B 三个规模共 8 个开放权重模型,上下文长度提升至 128K tokens,支持 8 种语言和工具调用。
推荐理由:官方发布说明覆盖了三个规模、内存需求和量化权重,读者可以据此选择适合自己硬件的部署与微调路径。
Hugging Face 发布教程,演示如何用 WWDC24 的新 Core ML 特性在 Mac 上复现 Mistral 7B 的端侧运行。
推荐理由:原文复现 WWDC24 的 Mistral 7B 端侧运行示例,讲解 MLTensor、状态缓存和 4-bit 量化等新特性与完整转换步骤。
Hugging Face 在 TGI 中推出 Multi-LoRA serving,只部署一次基座模型 mistralai/Mistral-7B-v0.1,即可按请求动态选择 LoRA 适配器,一次部署相当于服务多个微调模型。
推荐理由:原文给出部署步骤、显存开销和成本对比数据,读者可以据此评估一次部署服务多个微调模型是否适合自己的场景。
Mistral AI 发布 Mamba 架构的 Codestral Mamba,在 Albert Gu 和 Tri Dao 协助下训练,具备线性时间推理和理论无限序列建模能力,已测试 256k token 的上下文检索,参数量 7,285,403,648。
推荐理由:官方介绍了 Mamba 架构在线性推理和长序列上的特点、部署方式与许可证差异,读者可据此评估本地编码助手的可行性。
Hugging Face 宣布 Transformers 与 KerasHub 采用共享模型保存格式,KerasHub 现可直接加载 Hub 上 346,268 个 Transformers 库模型。
推荐理由:官方宣布 Transformers 与 KerasHub 共享模型保存格式,KerasHub 用户可直接加载 Hub 上 300K+ 模型并切换 TensorFlow、JAX 或 PyTorch 后端。
Hugging Face 宣布用户可在 Inference Endpoints 和 Spaces 上使用 Google Cloud TPU v5e 加速 AI 应用。
推荐理由:Hugging Face 官方宣布接入 Google TPU,给出了实例配置和价格,读者可据此评估推理部署的成本选项。
Banque des Territoires(CDC 集团)、Polyconseil 与 Hugging Face 于今年 1 月启动合作,为支持法国学校生态改造计划 EduRénov 构建基于 RAG 的主权数据方案,第一阶段已完成。
Intel 与 MILA 重构了多模态蛋白质语言模型 ProtST,并发布在 Hugging Face Hub 上,演示如何用 Intel Gaudi 2 加速器和 Optimum for Intel Gaudi 库进行推理与微调。
Hugging Face 发布博客,解释通过 Accelerate 使用 DeepSpeed 与 PyTorch FSDP 训练 Mistral-7B 时结果不一致的原因:DeepSpeed 默认把主权重上转 fp32,而 FSDP 原生不强制上转。
Hugging Face 在 TRL 中推出 RLOO(REINFORCE Leave One-Out)在线 RLHF 训练器,作为 PPO 的替代方案。
Hugging Face 解释为何要重新设计 Transformers 文档:内容随文本之外的模态、LLM 与优化时代增量堆积,显得杂乱难导航。改版将面向开发者,转向 code-first 和解决方案导向,并以灵活有机的结构取代僵化的 Diátaxis 分类,通过整合而非追加内容来统一文档体验。
Hugging Face 宣布面向 Amazon SageMaker 的 Embedding Container 正式可用(GA),基于 Text Embedding Inference(TEI),支持在 SageMaker 上高效部署嵌入模型以构建 RAG 等生成式 AI 应用。
Mistral 在 la Plateforme 推出模型定制能力,提供三条路径:开源微调 SDK mistral-finetune(基于 LoRA,可在自有基础设施微调全部开源模型)、平台无服务器微调服务(兼容 Mistral 7B 和 Mistral Small,后续数周将新增模型)以及面向特定客户、支持持续预训练的定制训练服务。
推荐理由:官方同时开放自托管微调 SDK、平台托管服务与定制训练三条路径,读者可据此对比选择适合自己的模型定制方式。