跳到正文

#模型发布

今日 2 条
今天10月2日周五
  1. The Decoder50

    Tavus 发布 Griffin 人际交互模型,近半数受试者一分钟视频通话中误认为真人

    Tavus 发布 Griffin,称其为首个 Human Interaction Model,可实时处理语音、表情、语调、手势和停顿并双向生成视频。Tavus 研究中 48% 的参与者在 1 分钟视频通话后认为 Griffin 是真人,此前系统最高为 2%;在所描述的 Nvidia 独立测试中 Griffin 得 3.83 分,人类为 3.92,此前最佳 AI 为 2.80。

  2. TechCrunch · AI52

    AWS 开源 Strands Decider 2B 决策模型

    AWS 发布开源决策模型 Strands Decider 2B,灵感来自 TypeSafe 的 Jev,可在预设选项间快速排序并输出置信度,小到可本地运行。该模型基于 Qen3.5-2B 的"躯干"构建,由杰出工程师 Marc Brooker 的业余项目演化而来,曾登上 Jevbench 同规模模型榜首;他称其能借助置信度和封闭答案域为 Agent 工作流提供更低延迟、更低成本且更可靠的步骤决策。

10月1日周四
  1. Latent Space77

    Google DeepMind 发布 Gemini 4 Argon,输出上限达 1M token

    Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,宣称在 19 项基准中的 13 项排名第一,输出上限从 64K 提升至 1M(通过 Long Decode Continuation 实现)。

    推荐理由:汇总了 Gemini 4 Argon 的基准成绩、定价与获取限制,并保留独立评测和质疑声音,读者可据此平衡官方宣传。

  2. TechCrunch · AI61

    Google 发布 Gemini 4 Argon,称其为迄今最强模型

    Google 发布 Gemini 4 Argon,主打防御性网络安全,可自主发现、验证并修补关键软件漏洞,目前仅通过 Fairwind 安全计划向部分网络安全伙伴开放。Google 称其在多项基准上显著领先 OpenAI GPT-6 Astra、Anthropic Fable 与 Opus,并援引 Vals 模型指数称其当前领先;8 月 Gemini 应用月用户已超 10 亿。

  3. The Verge · AI68

    Google 发布 Gemini 4 Argon,初期仅向受信任的网络防御者开放

    Google 发布新一代前沿模型 Gemini 4 Argon,称其在软件工程、法律和金融等企业知识工作以及网络防御方面具有前沿表现。初期仅限一组受信任的网络防御者使用,Google 正参与美国政府发布前模型访问的自愿流程并逐步扩大访问范围;该模型已用于 Google 内部工作流,如大规模代码库迁移。

9月30日周三
9月29日周二
  1. Hugging Face Blog60

    NVIDIA 开源表格基础模型 Kumo Tabular,单次前向预测登顶四大基准

    NVIDIA 发布开源表格基础模型 Kumo Tabular,对带标签的表格数据在单次前向传播中完成分类或回归预测,无需训练、调参或特征工程。

    推荐理由:官方发布开放表格基础模型,用上下文学习免训练预测,作者给出了架构细节和基准表现,读者可以评估它是否适合替换现有梯度提升树流程。

  2. OpenAI News66

    OpenAI 发布 GPT-6.1 Sol,价格为 Astra 的五分之一

    OpenAI 发布 GPT-6.1 Sol,面向编码、计算机操作和专业工作,提供接近 Astra 的智能水平,标准 API 输入与输出 token 价格为 Astra 的五分之一。

    推荐理由:官方宣布 GPT-6.1 Sol 以约五分之一的价格提供接近 Astra 的能力,读者可据此评估编码与办公场景的成本取舍。

  3. Latent Space37

    Claude Opus 5.5 擅长制作解释视频

    Claude Opus 5.5 本周发布,社区反响热烈,尤其被认为擅长制作解释视频。它在 SimpleBench 上以 88.4% 领跑,视觉评测被评为 Anthropic 迄今最佳视觉模型,成本比 Fable 5.1 低约 60%。此外,GPT-6 系列、Gemini 3.8 Flash、小米 MiMo-V2.6-Pro(MIT 开源、1M 上下文)等同周亮相。

9月28日周一
  1. Hugging Face Blog67

    Hcompany 发布 Holo4 智能体系列,含 27B 与 35B-A3B 两个版本并开源全部轨迹

    Hcompany 发布 Holo4 智能体系列模型,含 27B dense 和 35B-A3B MoE 两个尺寸,并更新发布 Holotron4 Nano。模型可通过 GUI、代码、MCP 和 API 多种接口操作软件,在 OSWorld 2.0 上 Holo4 27B 得分 61.7%(Opus 5.5 为 81.8%),35B-A3B 达 30.9%,参数量和成本显著更低。

    推荐理由:原文给出 OSWorld 2.0 等基准分数、成本对比和全部轨迹开源信息,读者可以据此评估这款多接口智能体模型是否适配自己的业务工作流。

9月24日周四
9月23日周三
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词在 100 多种语言和方言中定制角色声音,可从 30 秒音频样本复刻声音,并提供 2000 多个现成声音。

    推荐理由:官方介绍了两款 TTS 模型的定制能力、基准成绩和开放渠道,开发者可以据此评估语音生成方案的选型。

  2. Latent Space85

    Anthropic 发布 Claude Opus 5.5,与 OpenAI GPT-6 Sol/Luna 同日降价竞逐

    Anthropic 发布 Claude Opus 5.5,称多数任务达到 Fable 5.1 水平、比 Opus 5 快约 30%,token 定价从 $5/$25 降至 $4/$20,并成为 Claude Code 和 Claude 应用的默认模型;Sonnet 5.5 和 Haiku 5.5 将在未来数周推出。

    推荐理由:文章汇总了 Opus 5.5 的定价、跑分与争议,并对照 GPT-6 Sol/Luna,帮助读者理解两家降价背后的真实成本结构。

9月22日周二
  1. Latent Space79

    Xiaomi 发布 MiMo-V2.6-Pro 1T-A42B 开源全模态模型,训练成本约 300 万美元

    Xiaomi 发布 MiMo-V2.6 系列,含 Pro、Flash 两个原生全模态模型及 20 倍加速输出的 Pro-UltraSpeed,MiMo-V2.6-Pro 以 1.02T 总参数/42B 激活参数登上 Artificial Analysis Intelligence Index 开源权重模型榜首(46 分)。

    推荐理由:汇总了 MiMo-V2.6-Pro 的开源权重、价格与 RL 训练细节,读者可以了解小米进入前沿模型行列的具体依据。

9月21日周一
9月16日周三
9月9日周三
9月3日周四
9月1日周二
  1. Google Research53

    Google 发布 3.3 亿参数时间序列基础模型 TimesFM-3,支持零样本多变量预测

    Google Research 发布时间序列基础模型 TimesFM-3,参数量 3.3 亿,预训练语料超过 1 万亿时间点,原生支持零样本多变量预测。模型可同时预测多个目标序列,支持过去协变量与过去-未来协变量,通过交替注意力与 Contiguous Patch Masking 在单次前向传播中完成整段预测,每步输出第 10 到第 90 百分位共 9 个分位数。

8月27日周四
8月25日周二
8月21日周五
  1. Hugging Face Blog66

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理最高提速 3.2x

    Liquid AI 为 LFM2.5 系列三个模型(LFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1B)发布 DSpark 草稿模型检查点,采用投机解码在不改变输出质量的前提下大幅加速解码。

    推荐理由:官方给出 DSpark 草稿模型的具体加速数据、质量等价原理和 llama.cpp 与 SGLang 的用法,端侧部署可直接迁移。

8月14日周五
8月12日周三
  1. Google DeepMind68

    Google DeepMind 发布手语转文本模型 SL2T,落地 Gboard 与 Live Transcribe

    Google DeepMind 发布多语言手语转文本(SL2T)翻译模型,首次将手语 AI 带入消费产品,支持在 Pixel 11 的 Gboard 和 Live Transcribe 中以美式手语(ASL)输入英文。

    推荐理由:原文介绍了 SL2T 的训练数据、隐私设计与基准成绩,并说明其落地产品形态,读者可以了解手语翻译模型的可行路径。

8月10日周一
8月4日周二
  1. Mistral AI58

    Mistral 发布开源多模态安全分类模型 Shieldstral,Apache 2.0 权重可自由下载

    Mistral 发布 3B 开源多模态安全分类模型 Shieldstral,以 Apache 2.0 权重开放下载。它把内容审核建模为策略自适应的问答任务,推理时用自然语言写入审核政策即可返回校准的安全分数,无需重训练,可统一处理文本、图像及提示-回复对。官方称其在文本安全、拒答检测和多模态审核上匹配或超过最大 7 倍于其体积的开源护栏模型,可在单张 16GB GPU 上运行。

7月30日周四
  1. Google DeepMind69

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型,新增视频理解与多机器人协作

    Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层具身推理大脑,可编排 VLA 模型、导航 API 等底层工具完成多步任务。

    推荐理由:官方发布详细列出了视频理解、进度追踪、多机协作的量化指标与获取入口,读者可据此评估机器人任务编排能力的变化。

7月21日周二