Cognition CEO 谈如何用 OpenAI o1 编程
Cognition 联合创始人兼 CEO Scott Wu 解释了 OpenAI o1 如何以更像人类的方式做出编程决策。
Cognition 联合创始人兼 CEO Scott Wu 解释了 OpenAI o1 如何以更像人类的方式做出编程决策。
OpenAI 发布 SWE-bench 的人工验证子集 SWE-bench Verified,用于更可靠地评估 AI 模型解决真实软件问题的能力。
Mistral 宣布在 La Plateforme 上开放对 Mistral Large 2 和 Codestral 等旗舰及专家模型的定制,支持 base prompt、few-shot prompting 或 fine-tuning,可使用自己的数据集。
Mistral AI 发布 Mistral Large 2(版本 24.07,API 名称 mistral-large-2407),参数量 123B,拥有 128k 上下文窗口,MMLU 预训练准确率 84.0%。
Mistral AI 与 NVIDIA 联合发布 12B 模型 Mistral NeMo,支持 128k 上下文窗口,以 Apache 2.0 许可发布 base 与 instruct 权重,官方称其推理、世界知识和编码精度在该规模中达到 SOTA,可作 Mistral 7B 的直接替代。
推荐理由:官方原文给出 12B 规模、128k 上下文、Apache 2.0 权重和 Tekken 分词器的具体压缩数据,可据此评估其在 Mistral 7B 系统中的替换价值。
Mistral AI 发布 Mamba 架构的 Codestral Mamba,在 Albert Gu 和 Tri Dao 协助下训练,具备线性时间推理和理论无限序列建模能力,已测试 256k token 的上下文检索,参数量 7,285,403,648。
推荐理由:官方介绍了 Mamba 架构在线性推理和长序列上的特点、部署方式与许可证差异,读者可据此评估本地编码助手的可行性。
Numina 与 Hugging Face 合作微调的 NuminaMath 7B TIR 赢得首届 AIMO Progress Prize,在私有测试集 50 题中解出 29 题。
推荐理由:原文由获奖团队完整给出两阶段微调、SC-TIR 推理和防过拟合验证的做法,方法可迁移到数学推理模型训练。
Hugging Face 报告其基于 Transformers Agents 构建的 ReactCodeAgent 在 GAIA 基准上取得佳绩:验证集得分 44.2%,排名第一,领先第二名 4 分;测试集得分 33.3%,排名第二,超过 Microsoft Autogen 的提交,并在最难的 Level 3 题目上拿到最佳平均分。
Paf 在全公司采用 ChatGPT Enterprise,工程师每天使用 custom GPTs 加速日常开发任务,并将 ChatGPT Enterprise 集成到 grit:lab 编程学院(gritlab.ax),以 AI 增强的系统架构思维培养下一代软件开发者。目前 Paf 有 70% 的员工活跃使用 ChatGPT Enterprise,覆盖财务、HR、市场和客户支持等业务团队。
Hugging Face 发布 BigCodeBench,用于在无污染的实际编程任务上评估大语言模型,定位为 HumanEval 的新一代继任者。
Mistral AI 发布首个代码生成模型 Codestral,为 22B 开源权重模型,训练数据覆盖 80+ 编程语言,支持 32k 上下文窗口和 fill-in-the-middle 机制。
推荐理由:官方原文给出 22B 参数、32k 上下文、80+ 语言和多个基准对比,读者可以据此评估它在代码补全场景中的位置。
Meta 发布开源评测框架 CyberSecEval 2,用于评估 LLM 在生成不安全代码、提示词注入、协助网络攻击、代码解释器滥用和自动化攻击能力等方面的安全风险。评测显示,LLM 平均协助网络攻击的合规率已从上一版的 52% 降至 28%;提示词注入防护仍未解决,模型在端到端漏洞利用上能力有限。全部代码开源,并提供 leaderboard,欢迎社区贡献。
Hugging Face 团队发布 StarCoder2-15B-Instruct-v0.1,首个采用完全透明、许可开放管线的自对齐代码 LLM,无需人工标注或从专有大模型蒸馏数据。
Mistral AI 开源发布 Mixtral 8x22B,采用 Apache 2.0 许可证。该稀疏 MoE 模型总参数 141B、激活参数仅 39B,支持英语、法语、意大利语、德语和西班牙语,具备函数调用能力与 64K tokens 上下文窗口,官方称其速度快于任何稠密 70B 模型。
推荐理由:官方给出了参数结构、许可证和基准成绩,读者可据此评估它在大模型开源阵营中的性价比和适用场景。
UC Berkeley、MIT 和 Cornell 研究者推出 LiveCodeBench 排行榜,通过从 LeetCode、AtCoder、CodeForces 收集并标注发布日期的题目,检测并防止 benchmark 污染。
Google 与 Hugging Face 合作发布 CodeGemma,包含专注代码填充的 2B 基座、混合代码与自然语言的 7B 基座,以及 7B Instruct 对话版本,均支持 8K 上下文。
推荐理由:原文给出三个模型规格、基准对比与 FIM 提示词格式,读者可以据此选择适合延迟、显存或对话场景的版本。
JetBrains 使用 OpenAI 的 API 将 AI 嵌入开发者软件,打造出公司历史上增长最快的产品。通过集成 OpenAI API,JetBrains 在其开发者工具中加入了 AI 能力。
Hugging Face 发布开源数据集 WebSight,用于训练视觉语言模型将网页截图转换为 HTML 代码。其最新版 WebSight-v0.2 扩展至 200 万个样本,改用真实图像和 Tailwind CSS。基于该数据集微调的模型 Sightseer 可将截图转为可运行的 HTML,并能在生成代码中嵌入与原图相近的图像。
BigCode 发布 StarCoder2 系列开放代码模型,含 3B、7B、15B 三个规模,均基于新数据集 The Stack v2 训练,并同步开放模型、数据集及处理与训练代码。
推荐理由:官方完整披露三个模型规模、训练数据与开放范围,读者可据此评估开源代码模型的可复用程度。
Mistral 发布旗舰语言模型 Mistral Large,称其在常用基准上仅次于 GPT-4,可通过 la Plateforme 和 Azure 使用,支持 32K tokens 上下文、英法德西意多语言、function calling 和 JSON 输出。同时发布优化延迟与成本的 Mistral Small,性能超过 Mixtral 8x7B,并简化了端点产品线、新增多币种定价。
推荐理由:官方给出了 Mistral Large 的基准对比、多语言与 function calling 能力,读者可据此评估它在 API 可用模型中的位置。
Hugging Face 联合 Intel 展示了在第四代 Xeon(借助 AMX 加速)上优化 StarCoder-15B 推理的方法,通过 SmoothQuant 实现 Q8 量化,TTFT 加速约 2.19x、TPOT 加速约 2.20x 且精度无损失;再结合 4bit 权重唯一量化和 assisted generation,实现超过 7x 的推理加速。
Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可的开放权重稀疏混合专家模型(SMoE),在多数基准上超过 Llama 2 70B 且推理快 6 倍,多数标准基准上匹配或超越 GPT3.5。
推荐理由:官方给出稀疏专家架构的参数激活比例、基准对比与部署方案,为开源模型选型提供了具体的成本性能参考。
Hugging Face 博客用 LoRA 在灾难推文二分类任务上对比 RoBERTa-large、Llama-2-7b 和 Mistral 7B,均在单张 48GB A6000 上微调。
Hugging Face 发布教程,介绍如何用 Hugging Face GitHub 公共仓库代码微调 bigcode/starcoder (15.5B) 等模型,打造个人编程助手 HugCoder。
推荐理由:原文完整给出从数据采集到部署的微调流程,并附 QLoRA 与全量微调的成本和评测对比,方法可迁移到自有代码库。
Hugging Face 推出企业级代码助手 SafeCoder,基于 BigCode 项目开源的 StarCoder 模型(15.5B 参数、80+ 编程语言、8192-token 上下文窗口),训练数据为 The Stack 中 1 trillion 代码 token。
Hugging Face 发布 Code Llama 系列开源代码模型集成,含 7B、13B、34B 三种规格,基于 Llama 2 在 500B token 代码数据上训练,提供 Python 特化版和指令微调版。
推荐理由:官方完整介绍了模型规格、上下文扩展原理和生态接入方式,读者可以直接据此选择规格并上手部署使用。
Hugging Face 发布面向企业的代码助手解决方案 SafeCoder,支持客户在自有基础设施内微调并自托管 Code LLM,训练和推理过程中代码不离开客户 VPC。
Hugging Face 官方博客介绍 TRL 库新支持的 DPO 方法,无需奖励模型和 RL 步骤即可直接在偏好数据上优化语言模型。
推荐理由:原文提供了从 SFT 到 DPO 微调 Llama v2 的完整代码与训练脚本,读者可复用到自己的数据集上。
Hugging Face 发布教程,展示用 Node.js 搭建文本到网页应用的生成器,模型采用部署在 Inference Endpoints 上的 WizardCoder-15B,通过 Express.js 流式渲染生成 HTML。
推荐理由:Hugging Face 官方教程给出从 Endpoint 部署到流式渲染的完整代码,读者可以照着复现一个文本生成网页应用的服务。
Hugging Face 团队将 BigCode 的 StarCoder(16B 参数、8,192 token 上下文)微调为编程助手 StarChat alpha。
推荐理由:原文完整展示了用 OpenAssistant 对话数据和 DeepSpeed ZeRO-3 将 StarCoder 微调为编程助手的可复现流程,并附评估方法。
BigCode(由 Hugging Face 与 ServiceNow 联合主导)发布约 15B 参数的代码大模型 StarCoder 和 StarCoderBase,在 1 万亿 token 上训练,覆盖 80+ 编程语言。
推荐理由:官方发布且附完整评测数据,读者可以据此对比开源代码模型与闭源模型的实际差距。
Hugging Face 的 AI 游戏开发系列第五篇用 ChatGPT 为一个 5 天开发周期内的农场游戏生成故事内容,流程包括生成故事摘要、多轮精炼、撰写并扩展游戏内物品描述。文章指出语言模型易复刻《星露谷物语》等既有故事、长内容质量漂移并陷入重复,且直接使用生成内容可能带来法律、伦理和商业风险,建议将其用于头脑风暴、人工撰写最终内容。
Hugging Face 发布 AI 游戏开发系列教程第 1 部分,目标是用 AI 工具在 5 天内完成一个可玩的农场游戏。
Hugging Face 发布教程,介绍如何用 Intel 第四代 Xeon(Sapphire Rapids)CPU 集群在 AWS 上加速 PyTorch 训练。
推荐理由:原文给出在 Intel Sapphire Rapids CPU 集群上做分布式训练的完整步骤和实测数据,读者可以照搬这套方法。
Hugging Face 宣布将 Intel OpenVINO 加入 Optimum Intel,基于 OpenVINO 2022.2,可用 OVModels 在多种 Intel 处理器上运行托管在 hub 或本地的 Transformers 模型,并通过 NNCF 进行量化。
OpenAI Codex 现已通过 OpenAI API 为 70 个不同应用提供支持,覆盖多种使用场景。
OpenAI 发布新版 GPT-3 和 Codex,新增编辑和插入能力,不再只支持对现有文本做补全。
推荐理由:OpenAI 官方宣布 GPT-3 和 Codex 不再只能补全文本,新增编辑与插入能力,读者可据此了解 API 能力边界的变化。
Hugging Face 发布教程,展示如何从零训练名为 CodeParrot 的 GPT-2 代码生成模型。
推荐理由:原文从数据清洗到训练和评测完整走一遍预训练流程,方法步骤可迁移到读者自己的代码模型训练。
OpenAI 宣布其自然语言转代码系统 Codex 的改进版本,即日起通过 API 以 private beta 形式发布。
推荐理由:原文给出 Codex 新版本的自然语言转代码能力及 API 私测入口,读者可据此判断早期接入方式。
OpenAI 发表论文《Evaluating large language models trained on code》,主题为评估基于代码训练的大语言模型。抓取仅获取到标题,正文内容不可用。