OpenAI 发布 Model Spec 规范文档
OpenAI 发布 Model Spec,一份定义其模型期望行为的规范文档。材料抓取失败,仅标题可用,具体内容细节以原文为准。
OpenAI 发布 Model Spec,一份定义其模型期望行为的规范文档。材料抓取失败,仅标题可用,具体内容细节以原文为准。
OpenAI 推出新工具,帮助研究人员识别由其工具生成的内容,同时宣布加入内容来源与真实性联盟(C2PA)指导委员会,以推动行业标准。
ChatGPT 发布一年多后,OpenAI 阐述了其在 AI 时代的数据处理方法。公司同时推出 Media Manager,供创作者和内容所有者管理自己的内容,并介绍了未来方向。
Stack Overflow 与 OpenAI 宣布达成新的 API 合作,将全球领先的技术知识平台与 OpenAI 最受欢迎的 LLM 模型相结合,为开发者提供支持。
Hugging Face 推出专门评估希伯来语大语言模型的开放排行榜,包含四个基准:希伯来语问答(HeQ 数据集)、情感分析、Winograd Schema 指代消解和英希翻译,均采用 few-shot 提示格式评测。
Artificial Analysis 与 Hugging Face 合作上线 LLM Performance Leaderboard,覆盖 100 多个 serverless LLM API 端点的质量、价格与速度指标。
OpenAI 封禁了与伊朗起源的行动 IUVM 相关的账号,该行动利用 AI 生成并翻译支持伊朗、反对以色列和反对美国的网站内容。
Hugging Face 展示如何用自定义 inference handler 在 Inference Endpoints 上部署 Whisper ASR,并结合 Pyannote diarization pipeline 实现说话人分离,以及通过投机解码加速推理。
OpenAI 封禁了与中国相关的 "Spamouflage" 影响力行动所使用的账号。该行动利用 AI 研究社交媒体活动、生成帖子,并调试一个此前未被报道的网站。
OpenAI 封禁了与一个此前未报告、源自以色列的影响行动相关的账号,该行动被 OpenAI 命名为 Zero Zeno。行动使用 AI 生成反哈马斯、反卡塔尔、亲以色列、反印度人民党(BJP)以及亲以色列总工会 Histadrut 的内容。
OpenAI 封禁了一批此前未被披露、来自俄罗斯的“Bad Grammar”行动相关账号。该行动利用 AI 生成英语和俄语的 Telegram 评论,涉及乌克兰、摩尔多瓦、波罗的海国家及美国政治话题。
OpenAI 封禁了与俄罗斯来源影响力行动 "Doppelganger" 相关的账号。该行动利用 AI 生成针对乌克兰的反乌社交媒体评论、翻译及多种语言的网站文案。
Hugging Face Leaderboards 团队与 Dottxt 合作研究发现,MMLU 评测对提示词格式高度敏感,各模型分数随 8 种格式波动约 10 个点,Qwen1.5-7B 在不同提示下准确率从 22.9% 到 51.2%,且模型排名也随格式变化。
OpenAI 宣布与《金融时报》(Financial Times)合作,将 FT 的新闻内容引入 ChatGPT。双方还将合作,为 FT 读者打造新的 AI 体验。
Hugging Face 团队发布 StarCoder2-15B-Instruct-v0.1,首个采用完全透明、许可开放管线的自对齐代码 LLM,无需人工标注或从专有大模型蒸馏数据。
OpenAI 宣布 GPT-4 API 全面可用,GPT-3.5 Turbo、DALL·E 和 Whisper API 也已全面开放。同时发布 Completions API 旧模型的退役计划,这些旧模型将于 2024 年初退役。
推荐理由:官方宣布 GPT-4 等 API 全面开放并给出旧模型退役计划,开发者可据此调整接入与迁移安排。
OpenAI 宣布推出 ChatGPT 和 Whisper API。正文内容抓取失败,仅标题可用。
OpenAI 发文称将加速挽救生命疗法的研发。原文未提供更多细节。
Hugging Face 推出 Open CoT Leaderboard,追踪 LLM 生成有效链式推理的能力。榜单不评绝对准确率,而是计算有无 CoT 提示的准确率差值 Δ,以检验 CoT 对准确率的实际影响,并对训练数据污染更稳健。评测采用 LogiQA 和 LSAT 数据集(多数属于 AGIEval),任务以选择题形式呈现,目前已实现 Classic 和 Reflect 两种提示策略。
OpenAI 面向 API 客户端推出更多企业级功能,包括更多安全特性与管控能力、Assistants API 更新,以及更好管理成本的工具。此次更新旨在加强对企业客户的支持。
Hugging Face 发布 JAT,一个基于 Transformer 的多用途智能体项目,包含 Gato 的开放复现:发布了覆盖 Atari、BabyAI、Meta-World、MuJoCo 等环境的大量专家 RL 智能体、首个通用智能体训练数据集 JAT dataset(含数十万条专家轨迹)以及可玩电子游戏、控制机器人、执行导航指令的 JAT 模型。
OpenAI 发布关于指令分层(instruction hierarchy)的工作,目标是训练 LLM 优先处理特权指令。原文指出当前 LLM 易受提示词注入、越狱等攻击,攻击者可用恶意提示词覆盖模型的原始指令。
推荐理由:原文说明指令分层的动机,指出大语言模型易受提示词注入和越狱攻击的问题背景。
Hugging Face 推出 Open Medical-LLM Leaderboard,为医疗领域大语言模型提供标准化评测平台,以 accuracy 为主要指标,覆盖 MedQA、MedMCQA、PubMedQA 及 MMLU 医学相关子集等多个数据集。
Meta 发布 Llama 3 开源模型,提供 8B 和 70B 两种规模,各有 base 与 instruct 版本,并附基于 Llama 3 8B 微调的 Llama Guard 2,全部上架 Hugging Face Hub。
推荐理由:官方发布说明完整给出模型规格、许可证变化和部署微调路径,读者可据此评估升级与迁移成本。
Mistral AI 开源发布 Mixtral 8x22B,采用 Apache 2.0 许可证。该稀疏 MoE 模型总参数 141B、激活参数仅 39B,支持英语、法语、意大利语、德语和西班牙语,具备函数调用能力与 64K tokens 上下文窗口,官方称其速度快于任何稠密 70B 模型。
推荐理由:官方给出了参数结构、许可证和基准成绩,读者可据此评估它在大模型开源阵营中的性价比和适用场景。
UC Berkeley、MIT 和 Cornell 研究者推出 LiveCodeBench 排行榜,通过从 LeetCode、AtCoder、CodeForces 收集并标注发布日期的题目,检测并防止 benchmark 污染。
医疗与生命科学领域的生成式 AI 平台 Ryght 宣布正式发布 Ryght Preview,现已向所有用户公开。
Hugging Face 博客介绍 Gradio 的 reload 模式,用 gradio app.py 代替 python app.py 启动即可在不重启服务器的情况下载入最新代码改动。
Zama 团队将其基于全同态加密(FHE)的隐私保护机器学习框架 Concrete ML 的预编译模型上线 Hugging Face Endpoints,用户可一键部署 FHE 友好模型(如加密垃圾邮件检测的决策树)并在加密数据上直接推理。
Hugging Face 发布通用多模态模型 Idefics2,参数量 8B,权重以 Apache 2.0 许可开源,支持任意图文序列输入,可回答图像问题、描述视觉内容、从文档提取信息和执行基础算术。
推荐理由:官方发布 8B 开源多模态模型并给出基准对比和训练数据,读者可以直接在 Hub 和 transformers 中上手微调。
OpenAI 宣布开设首家亚洲办公室 OpenAI Japan,并针对日语推出定制优化的 GPT-4 模型。这是该公司首次在亚洲设立办公室,标志着其日本市场布局的落地。
Hugging Face 发布视觉语言模型入门教程,介绍其图像编码器、投影层与文本解码器等核心结构,并列出 LLaVA 1.6、KOSMOS-2、Qwen-VL 等开源模型。
Hugging Face 宣布在 Hub 上推出 Deploy on Google Cloud 集成,可将数千个基础模型通过 Vertex AI 或 GKE 部署到用户自己的 Google Cloud 账户中。
Google 与 Hugging Face 合作发布 CodeGemma,包含专注代码填充的 2B 基座、混合代码与自然语言的 7B 基座,以及 7B Instruct 对话版本,均支持 8K 上下文。
推荐理由:原文给出三个模型规格、基准对比与 FIM 提示词格式,读者可以据此选择适合延迟、显存或对话场景的版本。
Klarna 的 AI 助手承担了相当于 700 名全职客服的工作量。该助手被用于革新个人购物、客户服务和员工生产力。
Hugging Face 宣布与云安全公司 Wiz 合作,已集成 Wiz 用于漏洞管理和云安全态势管理,并自动修复 Spaces 中的问题。Wiz 研究人员通过 pickle 发现其沙箱计算环境的缺陷,相关漏洞已全部修复。官方建议用户在生产环境弃用 pickle、改用 Safetensors,并警告 pickle 未来可能不再受支持。
DuckDB-NSQL-7B 是 MotherDuck 和 Numbers Station 专为 DuckDB SQL 推出的 text2SQL 模型,基于 Meta 的 Llama-2-7b 微调,可生成包括 SELECT 在内的多种有效 DuckDB SQL 语句。
OpenAI 为 fine-tuning API 新增多项功能,帮助开发者更精细地控制微调流程,同时宣布扩展自定义模型(custom models)计划的合作方式,为开发者提供更多基于 OpenAI 模型构建定制模型的选择。
SetFit 是 Hugging Face 与 Intel Labs、UKP Lab 合作开发的少样本微调框架,在 Banking 77 数据集上,5-shot 表现优于 3-shot GPT-4,无需提示词且训练推理速度比 LLM 方法快一个数量级以上。
Harvey 与 OpenAI 合作,为法律专业人士构建一个定制训练的模型。该合作将 OpenAI 的模型能力与 Harvey 在法律领域的应用经验结合,打造面向法律行业的专属模型。