如何在 Intel Gaudi 2 上加速蛋白质语言模型 ProtST
Intel 与 MILA 重构了多模态蛋白质语言模型 ProtST,并发布在 Hugging Face Hub 上,演示如何用 Intel Gaudi 2 加速器和 Optimum for Intel Gaudi 库进行推理与微调。
Intel 与 MILA 重构了多模态蛋白质语言模型 ProtST,并发布在 Hugging Face Hub 上,演示如何用 Intel Gaudi 2 加速器和 Optimum for Intel Gaudi 库进行推理与微调。
Hugging Face 报告其基于 Transformers Agents 构建的 ReactCodeAgent 在 GAIA 基准上取得佳绩:验证集得分 44.2%,排名第一,领先第二名 4 分;测试集得分 33.3%,排名第二,超过 Microsoft Autogen 的提交,并在最难的 Level 3 题目上拿到最佳平均分。
OpenAI 发布基于 GPT-4 的模型 CriticGPT,它能对 ChatGPT 的回复撰写批评意见,帮助人类训练员在 RLHF 过程中发现错误。
推荐理由:基于 GPT-4 的 CriticGPT 为 ChatGPT 回复写批评意见,帮助人类训练员在 RLHF 中发现错误。
OpenAI 与 TIME 达成战略合作,利用其 101 年档案内容增强模型回答,并提供指向 Time.com 报道的链接。
Google 发布开源大语言模型 Gemma 2,提供 9B 和 27B 两种参数规模,各有 base 与 instruction-tuned 版本,已上架 Hugging Face Hub。
推荐理由:Hugging Face 官方介绍 Gemma 2 四个开放权重模型的技术细节与生态集成,并给出 transformers、TRL 微调和 Inference Endpoints 部署的可用方法。
总部位于多伦多的知识产权 AI 公司 XLSCOUT 联合 Hugging Face Expert Support Program 推出专利嵌入模型 ParaEmbed 2.0,通过在专家精选的多领域专利数据上微调,准确率较 2023 年 10 月发布的 ParaEmbed 1.0 提升 23%。
Hugging Face 伦理与社会通讯第 6 期探讨 AI 数据质量:Reddit 与 Google 的内容合作因 RAG 搜索引擎输出“披萨加胶水”等错误推荐而受挫,说明并非所有数据都同样优质。好数据的关键在于与任务匹配,需具备相关性、全面性、时效性并缓解偏见。文章还阐述高质量数据可提升模型性能、鲁棒性、效率与可复现性,并建议通过去重、内容过滤、人工反馈和数据治理框架来保障质量。
Hugging Face 发布 Florence-2 微调教程。微软 2024 年 6 月发布的 Florence-2 有 0.2B 和 0.7B 两种规模,官方模型不含 VQA 能力。
OpenAI 官方宣布收购 Rockset。本次公告仅含标题,未提供更多交易细节。
OpenAI 推出网络安全资助计划,支持网络安全领域的创新研究及 AI 技术在其中的应用。该计划面向防御者,旨在推动 AI 与网络安全的融合。
OpenAI 介绍了一致性模型训练的改进技术。一致性模型是一类新兴生成模型,无需对抗训练即可一步生成高质量数据样本。
Consistency Models 是 OpenAI 发布的一项生成模型研究,针对扩散模型的问题提出改进。扩散模型虽显著推进了图像、音频和视频生成,但其依赖的迭代采样过程导致生成速度慢。
OpenAI 提出一种整体化方法,用于构建健壮且实用的自然语言分类系统,服务真实世界的内容审核场景。该方案聚焦undesired content(不良内容)检测的实际落地,兼顾系统稳健性与可用性。
Hugging Face 与 Argilla 合作的 Data Is Better Together 计划回顾了开源社区共建数据集的进展。
视觉演示软件公司 Prezi 加入了 Hugging Face Expert Support Program,由专属专家协助其将更小、更高效的开源模型整合进 ML 工作流,包括在管线中引入开源 re-ranker 模型,以比 LLM 更便宜、更快、更好地为演示文稿匹配图片与文本。
Paf 在全公司采用 ChatGPT Enterprise,工程师每天使用 custom GPTs 加速日常开发任务,并将 ChatGPT Enterprise 集成到 grit:lab 编程学院(gritlab.ax),以 AI 增强的系统架构思维培养下一代软件开发者。目前 Paf 有 70% 的员工活跃使用 ChatGPT Enterprise,覆盖财务、HR、市场和客户支持等业务团队。
Hugging Face 发布 BigCodeBench,用于在无污染的实际编程任务上评估大语言模型,定位为 HumanEval 的新一代继任者。
Color Health 与 OpenAI 合作推出 Cancer Copilot 应用,利用 GPT-4o 识别缺失的诊断检查并生成个性化工作计划,帮助医护人员就癌症筛查和治疗做出循证决策,加速患者获得治疗的进程。
OpenAI 宣布任命美国陆军退役上将 Paul M. Nakasone 进入董事会,其将为不断扩大的董事会带来网络安全经验,并将加入董事会的安全与保障委员会。
推荐理由:官方宣布美国陆军退役上将 Paul M. Nakasone 加入董事会并进入安全与保障委员会,读者可据此关注其网络安全背景对公司安全方向的影响。
Hugging Face 发布博客,解释通过 Accelerate 使用 DeepSpeed 与 PyTorch FSDP 训练 Mistral-7B 时结果不一致的原因:DeepSpeed 默认把主权重上转 fp32,而 FSDP 原生不强制上转。
Hugging Face 在 TRL 中推出 RLOO(REINFORCE Leave One-Out)在线 RLHF 训练器,作为 PPO 的替代方案。
Stable Diffusion 3 Medium(2B 参数)现已在 Hugging Face Hub 开放,可通过 🧨 Diffusers 使用,并附 DreamBooth 与 LoRA 训练脚本。
推荐理由:Hugging Face 官方讲解了 SD3 的 MMDiT 架构与 Diffusers 用法,附内存与性能优化数据,可直接迁移到自己的推理和微调流程。
OpenAI 与 Apple 宣布建立合作关系,将 ChatGPT 整合到 Apple 体验中。本次为官方简短公告,未提供更多整合细节。
推荐理由:原文出自 OpenAI 官方公告,说明合作双方和整合方向,可作为了解两家公司合作基本事实的入口。
OpenAI 宣布迎来两位高管:Sarah Friar 出任 CFO,Kevin Weil 出任 CPO。
OpenAI 深入解析其文生语音模型 Voice Engine 的技术原理,并介绍围绕它开展的安全研究。文章探讨了该模型背后的技术机制。
Hugging Face 解释为何要重新设计 Transformers 文档:内容随文本之外的模态、LLM 与优化时代增量堆积,显得杂乱难导航。改版将面向开发者,转向 code-first 和解决方案导向,并以灵活有机的结构取代僵化的 Diátaxis 分类,通过整合而非追加内容来统一文档体验。
Hugging Face 宣布面向 Amazon SageMaker 的 Embedding Container 正式可用(GA),基于 Text Embedding Inference(TEI),支持在 SageMaker 上高效部署嵌入模型以构建 RAG 等生成式 AI 应用。
OpenAI 使用新的稀疏自编码器扩展技术,自动识别出 GPT-4 计算过程中的 1600 万个模式。
推荐理由:OpenAI 用稀疏自编码器扩展技术从 GPT-4 中提取 1600 万个模式,关注可解释性方向的读者可以了解其规模化路径。
Artificial Analysis 与 Hugging Face 推出基于人类偏好的 Text to Image 排行榜和 Image Arena,ELO 分数基于 Arena 收集的 45,000 多条人类图像偏好计算,每个模型生成 700 多张图像。
Mistral 在 la Plateforme 推出模型定制能力,提供三条路径:开源微调 SDK mistral-finetune(基于 LoRA,可在自有基础设施微调全部开源模型)、平台无服务器微调服务(兼容 Mistral 7B 和 Mistral Small,后续数周将新增模型)以及面向特定客户、支持持续预训练的定制训练服务。
推荐理由:官方同时开放自托管微调 SDK、平台托管服务与定制训练三条路径,读者可据此对比选择适合自己的模型定制方式。
Mistral AI 于 6 月 5 日至 30 日举办线上微调黑客松,参赛项目须使用其微调 API。前三名各获 2500 欧元 Mistral API 额度,部分参与者可申请 100 美元免费额度。参赛可个人或组队(最多 4 人),需提交代码链接、项目描述和不超过 2 分钟的视频,评分涵盖影响力、技术实现、创意与展示各占 25%。
Cubzh 和 Gigax 联合 Hugging Face 发布 NPC-Playground,一个可在浏览器直接体验的 3D 演示,玩家可与 LLM 驱动的 NPC 对话互动。
Hugging Face 将 assisted generation(基于 Speculative Sampling)适配并优化到 Intel Gaudi 处理器,现已合入 Optimum Habana,通过 .generate() 的 assistant_model 参数指定 draft 模型即可使用。
Hugging Face 通报其 Spaces 平台遭未授权访问,部分 Spaces 秘钥可能被读取,官方已撤销相关 HF token 并邮件通知受影响用户。官方建议用户刷新密钥或改用细粒度访问 token,已移除 org token、为 Spaces 秘钥部署 KMS,并计划在功能对齐后弃用经典读写 token,同时已报警并向数据保护机构报告。
推荐理由:官方通报了 Spaces 秘钥未授权访问事件、已撤销的 token 范围和 KMS 等整改措施,受影响用户可据此排查自身密钥。
OpenAI 终止了与隐蔽影响力行动相关的账号。这些行动试图利用其服务进行欺骗性内容生成,但未因使用 OpenAI 服务而获得显著的受众增长。
OpenAI 推出 OpenAI for Education,这是一项面向大学的经济实惠方案,帮助高校以负责任的方式将 AI 引入校园。该方案聚焦教育场景,降低院校部署 AI 的成本门槛。
OpenAI 发布 OpenAI for Nonprofits 新计划,提升其工具对非营利组织的可及性。该计划为非营利组织使用 ChatGPT Team 和 Enterprise 提供折扣价格。
Mistral AI 发布首个代码生成模型 Codestral,为 22B 开源权重模型,训练数据覆盖 80+ 编程语言,支持 32k 上下文窗口和 fill-in-the-middle 机制。
推荐理由:官方原文给出 22B 参数、32k 上下文、80+ 语言和多个基准对比,读者可以据此评估它在代码补全场景中的位置。
MavenAGI 推出一款基于 GPT-4 构建的 AI 客服智能体。Tripadvisor、Clickup 和 Rho 等公司已在使用该智能体,以节省时间并更好地服务客户。
Mistral AI 推出 Mistral AI 非生产许可(MNPL),允许开发者将技术用于非商业目的和科研工作,Codestral 当日即在该许可下发布。公司表示将继续在 Apache 2.0 下发布模型和代码,逐步形成两个许可家族并行,以在开放原则与商业化之间取得平衡。
推荐理由:官方说明 MNPL 许可的适用范围和与 Apache 2.0 并行的策略,可帮助开发者判断商用与研究的合规边界。