跳到正文

全部动态

今日 36 条
12月20日周五
  1. OpenAI News60

    OpenAI 发布 Deliberative alignment 研究,让 o1 模型通过推理执行安全规范

    OpenAI 推出面向 o1 模型的新对齐策略 Deliberative alignment,直接教模型安全规范并让其对这些规范进行推理。该方法旨在通过推理能力提升语言模型的安全性。

    推荐理由:OpenAI 官方介绍了 o1 系列采用的对齐策略思路,可作为理解推理能力如何用于安全规范的参考材料。

12月19日周四
12月18日周三
12月17日周二
12月16日周一
  1. Hugging Face Blog66

    Hugging Face 发布 Synthetic Data Generator,用自然语言生成自定义数据集

    Hugging Face 发布 Synthetic Data Generator,一款无代码应用,通过三步流程(描述数据集、配置微调、生成推送)用 LLM 从自定义提示词生成数据集,底层由 distilabel 和免费 Hugging Face 文本生成 API 驱动。

    推荐理由:官方介绍这款无代码合成数据工具的完整流程与可配置项,读者可据此判断能否用自然语言快速搭建数据集和模型。

12月13日周五
12月10日周二
12月9日周一
  1. OpenAI News80

    OpenAI 发布视频生成模型 Sora,已上线 sora.com

    OpenAI 宣布视频生成模型 Sora 上线,用户可在 sora.com 使用。支持生成最高 1080p、最长 20 秒的视频,可选宽屏、竖屏或方形比例,还可导入自有素材进行扩展、混剪与融合,或从文本生成全新内容。

    推荐理由:官方公布视频生成的分辨率、时长与素材混用方式,读者可据此判断是否把 Sora 纳入现有视频创作流程。

  2. OpenAI News67

    OpenAI 发布 Sora 视频生成模型系统卡

    OpenAI 发布 Sora 视频生成模型的系统卡。Sora 接受文本、图像和视频输入并生成新视频,建立在 DALL-E 和 GPT 模型的经验之上,旨在为人们的叙事和创意表达提供更多工具。

    推荐理由:官方系统卡说明了 Sora 的输入输出形式和模型来源,读者可以据此了解其能力定位。

12月5日周四
  1. Hugging Face Blog62

    Google 发布视觉语言模型 PaliGemma 2,含 3B、10B、28B 三种规模

    Google 发布视觉语言模型 PaliGemma 2,将 SigLIP 图像编码器与 Gemma 2 语言模型结合,提供 3B、10B、28B 三种规模,支持 224x224、448x448 和 896x896 三种输入分辨率。

    推荐理由:Google 发布 PaliGemma 2 视觉语言模型,提供 3B、10B、28B 三种规模与多分辨率选择,并附 transformers 集成和微调脚本。

12月4日周三
  1. Hugging Face Blog30

    用 3C3H 重新思考 LLM 评测:AraGen 基准与排行榜

    Hugging Face 发布面向阿拉伯语 LLM 的生成式评测基准与排行榜 AraGen,并推出新的 NLG 评测指标 3C3H。3C3H 基于 LLM-as-judge,从正确性、完整性、简洁性、有用性、诚实性与无害性六个维度评估模型回答,兼顾事实性与可用性。排行榜采用动态评测:数据集和评测代码先私有盲测三个月,到期后公开并更换新数据集,以缓解数据污染问题。

12月3日周二
12月2日周一
11月26日周二
11月25日周一
  1. Hugging Face Blog60

    Hugging Face 博客逐步推导 Transformer 位置编码如何演进到 RoPE

    Hugging Face 博客以迭代推导方式讲解位置编码设计,从整数编码、二进制编码到正弦编码,最终推导出 Llama 3.2 等现代 Transformer 采用的 RoPE。

    推荐理由:文章把 RoPE 的设计过程拆成可跟随的迭代推导,从整数编码一步步走到旋转矩阵,适合想理解位置编码原理的读者。

11月21日周四
11月20日周三
  1. Hugging Face Blog42

    让大模型辩论:首届多语言 LLM 辩论竞赛

    BAAI 推出 FlagEval Debate「Debate Arena」平台,让大模型两两辩论比拼推理与语言能力,目前支持中文、英文、阿拉伯语和韩语四语种。平台采用专家评审加用户投票的双评估体系,并允许参赛团队微调模型参数与对话策略。相比 LMSYS Chatbot Arena 等静态或用户投票式评测,它能缓解区分度不足、模型各自独立生成和投票偏好偏差等问题。

11月19日周二
  1. OpenAI News18

    Rox 全面押注 OpenAI

    Rox 全面押注 OpenAI,将其商业经验与深度 LLM 专长和 OpenAI 模型相结合。该方案旨在让每一位销售人员都达到前 1% 销售精英的水平。

11月18日周一
  1. Mistral AI68

    Mistral AI 为 le Chat 推出联网搜索、Canvas、图像生成与 Agents 等新功能

    Mistral AI 宣布对旗下免费 AI 助手 le Chat 进行重大更新,新增带引用的联网搜索、Canvas 创作界面、Agents 自动化工作流,并以免费 beta 形式提供。

    推荐理由:官方公布 le Chat 一批免费 beta 功能及与 ChatGPT 等竞品的功能对比表,读者可以据此判断它作为替代方案的位置。

  2. Mistral AI66

    Mistral 发布 124B 开源权重多模态模型 Pixtral Large

    Mistral 发布 Pixtral Large,一个基于 Mistral Large 2 的 124B 开源权重多模态模型,在 MathVista 达到 69.4%,DocVQA 与 ChartQA 上超过 GPT-4o 和 Gemini-1.5 Pro,LMSys Vision Leaderboard 上领先最近的开放权重模型近 50 ELO。

    推荐理由:官方给出关键基准数字和开放下载渠道,读者可以据此判断该多模态模型在图像理解和文本能力上的定位。