AI 在 The Met「Sleeping Beauties: Reawakening Fashion」展览中展现艺术潜力
AI 的艺术潜能在 The Met 服装学院的合作展览「Sleeping Beauties: Reawakening Fashion」中得到展现。展览体现了 AI 如何通过美与创造力丰富生活,凸显了 AI 在艺术领域的应用价值。
AI 的艺术潜能在 The Met 服装学院的合作展览「Sleeping Beauties: Reawakening Fashion」中得到展现。展览体现了 AI 如何通过美与创造力丰富生活,凸显了 AI 在艺术领域的应用价值。
Hugging Face 复现 Google 的 Infini-attention 论文后发现,压缩记忆次数越多,性能反而越差,90% 的时间花在调试收敛问题上。
OpenAI 发布 SWE-bench 的人工验证子集 SWE-bench Verified,用于更可靠地评估 AI 模型解决真实软件问题的能力。
Hugging Face 发布 ggml 入门教程,介绍这个专注于 Transformer 推理的 C/C++ 开源机器学习库。教程讲解 ggml_context、ggml_cgraph、ggml_backend 等核心概念,给出在 Ubuntu 上编译运行矩阵乘法示例的完整步骤,并演示了使用 backend、打印计算图和导出 graphviz 格式的方法。
阿布扎比 TII 基于 Mamba 架构发布开源模型 Falcon Mamba 7B,采用 TII Falcon Mamba 7B License 1.0,称在 LLM Leaderboard 两版基准上平均分领先多数同类 Transformer 与 SSM 模型。
推荐理由:原文给出架构设计、训练数据和两版评测基准数字,读者可据此判断无注意力 7B 模型与主流 Transformer 的差距。
Hugging Face 宣布 Transformers 现已提供跨多个热门模型家族的统一工具调用 API,同一份代码可在 Mistral、Cohere、NousResearch 和 Llama 模型间基本无需修改地移植。
推荐理由:原文给出统一工具调用 API 的设计思路和完整代码示例,开源开发者可以照搬接入多个模型家族。
Zico Kolter 加入 OpenAI 董事会,并将加入安全与安保委员会(Safety & Security Committee)。此举旨在以 AI 安全与对齐领域的专业能力强化 OpenAI 的治理。
Hugging Face 官方宣布收购总部位于西雅图的 XetHub,团队来自曾在 Apple 构建内部 ML 基础设施的 Yucheng Low、Ajit Banerjee 和 Rajat Arya。
推荐理由:收购方官方说明整合路径,给出了 Git LFS 换自研存储后对大文件更新方式的具体改变和当前 Hub 规模数据。
Rakuten 将数据与 AI 结合,挖掘客户洞察并释放价值,借助 API 让数据能力转化为客户价值。
Mistral 宣布在 La Plateforme 上开放对 Mistral Large 2 和 Codestral 等旗舰及专家模型的定制,支持 base prompt、few-shot prompting 或 fine-tuning,可使用自己的数据集。
OpenAI 在 API 中推出 Structured Outputs,模型输出现在能可靠地遵循开发者提供的 JSON Schema。
推荐理由:官方说明模型输出可稳定遵循开发者提供的 JSON Schema,对需要可靠结构化输出的工程场景有直接参考价值。
Hugging Face 与 Albumentations AI 合作推出面向文档图像的多模态数据增强 pipeline,可同时修改图像内容与文本标注,用于 VLM 微调。
Hugging Face 盘点截至 2024 年 8 月 6 日 Hub 上的主要安全功能。所有用户可用细粒度 token、双因素认证(2FA)、GPG commit signing、组织级访问控制,以及自动安全扫描流水线(ClamAV 恶意软件扫描、picklescan 扫描 pickle 文件、trufflehog 扫描密钥)。
Google 在 Gemma 2 发布一个月后推出三款新模型:2.6B 参数的 Gemma 2 2B(含 base 和 instruct 版本,适合端侧使用)、基于 Gemma 2 的安全分类器系列 ShieldGemma(2B/9B/27B)以及覆盖 Gemma 2 2B 和 9B 每一层的开源稀疏自编码器套件 Gemma Scope。
推荐理由:原文详细给出 Gemma 2 2B 的端侧用法、辅助生成加速和两个配套工具的评测,对部署和模型解释研究都有可操作的参考价值。
Hugging Face 发布教程,介绍如何用 Quanto 对 Diffusers 中的 Transformer 扩散管线(PixArt-Sigma、Stable Diffusion 3、Aura Flow)做 FP8/INT8/INT4 量化以降低显存占用。
Hugging Face 推出 NVIDIA NIM API (serverless) 推理服务,面向 Enterprise Hub 组织,基于 NVIDIA DGX Cloud 的 H100 GPU 按请求计算时间计费,价格为 $8.25/小时(约 $0.0023/秒)。
OpenAI 正在测试 SearchGPT,这是一个新搜索功能的临时原型。它可以为用户提供快速、及时的答案,并附上清晰、相关的来源。
Hugging Face 在开发 Docmatix 时发现,在其上微调的 Florence-2 在 DocVQA 上表现出色,却因答案格式差异在传统指标上得分很低,额外针对 DocVQA 微调反而被人工评估认为更差。
Mistral AI 发布 Mistral Large 2(版本 24.07,API 名称 mistral-large-2407),参数量 123B,拥有 128k 上下文窗口,MMLU 预训练准确率 84.0%。
OpenAI 开发并应用了一种基于规则的奖励(Rule-Based Rewards,RBRs)新方法,用于对齐模型的安全行为,无需大量人工数据收集。该方法已在 OpenAI 的模型上落地应用。
Meta 发布 Llama 3.1 系列,在 Hugging Face Hub 上线 8B、70B、405B 三个规模共 8 个开放权重模型,上下文长度提升至 128K tokens,支持 8 种语言和工具调用。
推荐理由:官方发布说明覆盖了三个规模、内存需求和量化权重,读者可以据此选择适合自己硬件的部署与微调路径。
Hugging Face 发布教程,演示如何用 WWDC24 的新 Core ML 特性在 Mac 上复现 Mistral 7B 的端侧运行。
推荐理由:原文复现 WWDC24 的 Mistral 7B 端侧运行示例,讲解 MLTensor、状态缓存和 4-bit 量化等新特性与完整转换步骤。
OpenAI 发布 GPT-4o mini,定位为更具成本效益的模型。
Mistral AI 与 NVIDIA 联合发布 12B 模型 Mistral NeMo,支持 128k 上下文窗口,以 Apache 2.0 许可发布 base 与 instruct 权重,官方称其推理、世界知识和编码精度在该规模中达到 SOTA,可作 Mistral 7B 的直接替代。
推荐理由:官方原文给出 12B 规模、128k 上下文、Apache 2.0 权重和 Tekken 分词器的具体压缩数据,可据此评估其在 Mistral 7B 系统中的替换价值。
Hugging Face 发布 Docmatix,一个面向文档视觉问答(DocVQA)的大型数据集,含 240 万张图像和 950 万问答对,来自 130 万份 PDF,规模为此前数据集的 240 倍。
OpenAI 为 ChatGPT Enterprise 推出合规 API 集成(Compliance API)、SCIM 用户管理和 GPT 控制功能,用于支持企业合规计划、数据安全和大规模用户访问管理。
Hugging Face 在 TGI 中推出 Multi-LoRA serving,只部署一次基座模型 mistralai/Mistral-7B-v0.1,即可按请求动态选择 LoRA 适配器,一次部署相当于服务多个微调模型。
推荐理由:原文给出部署步骤、显存开销和成本对比数据,读者可以据此评估一次部署服务多个微调模型是否适合自己的场景。
OpenAI 探讨了 prover-verifier games(证明者-验证者博弈)如何提升语言模型输出的可读性。该方法使 AI 给出的解决方案更清晰、更易验证,对人类和机器而言都更值得信赖。
Mistral AI 发布 Mathstral,一个基于 Mistral 7B、面向 STEM 复杂多步推理的指令模型,与 Project Numina 合作产出,权重托管在 HuggingFace。
Mistral AI 发布 Mamba 架构的 Codestral Mamba,在 Albert Gu 和 Tri Dao 协助下训练,具备线性时间推理和理论无限序列建模能力,已测试 256k token 的上下文检索,参数量 7,285,403,648。
推荐理由:官方介绍了 Mamba 架构在线性推理和长序列上的特点、部署方式与许可证差异,读者可据此评估本地编码助手的可行性。
Hugging Face 发布 SmolLM 小型语言模型系列,提供 135M、360M 和 1.7B 三种参数规模,并同步开源训练语料 SmolLM-Corpus。
推荐理由:官方公开了小型模型的数据配比、训练细节和完整语料,同档评测结果与端侧部署信息都可查证,适合关心小模型训练的人参考。
Hugging Face 团队发布教程,讲解如何用 distilabel 从 Argilla 2.0 技术文档合成三元组数据,微调 BAAI/bge-base-en-v1.5 嵌入模型(结合 TripletLoss 与 MatryoshkaLoss)。
Numina 与 Hugging Face 合作微调的 NuminaMath 7B TIR 赢得首届 AIMO Progress Prize,在私有测试集 50 题中解出 29 题。
推荐理由:原文由获奖团队完整给出两阶段微调、SC-TIR 推理和防过拟合验证的做法,方法可迁移到数学推理模型训练。
OpenAI 与洛斯阿拉莫斯国家实验室宣布建立研究合作关系,双方将共同开发安全评估方法,用于评估和衡量前沿模型相关的生物能力与风险。
Hugging Face 正在 Dataset Hub 上试验一项新功能,使用开源 PII 检测工具 Presidio 自动生成数据集中个人身份信息(PII)的报告。报告可帮助开发者在训练前评估数据集的 PII 风险,也帮助数据集所有者在发布前验证其 PII 过滤流程。Hugging Face 还感谢法国 CNIL 在 GDPR 合规方面提供的指导。
TRL 库现已支持对视觉语言模型做 DPO 偏好优化训练,官方博客以 Idefics2-8b 为例给出完整教程。
推荐理由:原文给出从数据格式化、显存估算到 LoRA 量化的完整 DPO 训练流程,读者可直接迁移到自己的 VLM 微调场景。
Hugging Face 宣布 Transformers 与 KerasHub 采用共享模型保存格式,KerasHub 现可直接加载 Hub 上 346,268 个 Transformers 库模型。
推荐理由:官方宣布 Transformers 与 KerasHub 共享模型保存格式,KerasHub 用户可直接加载 Hub 上 300K+ 模型并切换 TensorFlow、JAX 或 PyTorch 后端。
Hugging Face 宣布用户可在 Inference Endpoints 和 Spaces 上使用 Google Cloud TPU v5e 加速 AI 应用。
推荐理由:Hugging Face 官方宣布接入 Google TPU,给出了实例配置和价格,读者可据此评估推理部署的成本选项。
Banque des Territoires(CDC 集团)、Polyconseil 与 Hugging Face 于今年 1 月启动合作,为支持法国学校生态改造计划 EduRénov 构建基于 RAG 的主权数据方案,第一阶段已完成。
Hugging Face 为 Dataset Hub 的 Dataset Search 推出四项新功能:按模态(文本、图像、音频、表格等)、按行数大小、按存储格式、按兼容库筛选。行数信息基于文件元数据,元数据缺失时按前 5GB 内容估算。这些筛选可与 Language、Tasks、Licenses 等现有过滤器组合使用。