跳到正文

全部动态

今日 4 条
4月24日周五
  1. Hugging Face Blog83

    DeepSeek 发布 V4:MoE 双检查点上线 Hub,主打百万 token 上下文的 Agent 能力

    DeepSeek 发布 V4,在 Hub 上开源 DeepSeek-V4-Pro(1.6T 总参数 / 49B 激活)和 DeepSeek-V4-Flash(284B 总参数 / 13B 激活)两个 instruct 及对应 base 检查点,均支持 1M token 上下文。

    推荐理由:文章拆解了 V4 为长上下文与 Agent 场景做的架构与后训练设计,读者可据此评估开源模型跑长任务的部署成本。

4月13日周一
4月9日周四
  1. Hugging Face Blog65

    Overworld 发布实时视频世界模型 Waypoint-1.5,消费级 GPU 可本地运行

    Overworld 发布实时视频世界模型 Waypoint-1.5,权重已上传 Hugging Face。在 RTX 3090 至 5090 桌面硬件上可实时生成最高 720p、60 FPS 的交互环境,另提供面向游戏笔记本等更广消费级硬件的 360p 档位,Apple Silicon 支持即将推出。

    推荐理由:原文给出两档模型的具体硬件门槛、帧率分辨率和约百倍数据训练规模,读者可据此判断自己的设备能否本地运行。

4月3日周五
  1. Google DeepMind79

    Google DeepMind 发布 Gemma 4 开源模型,E2B/E4B/26B MoE/31B 四尺寸

    Google DeepMind 发布 Gemma 4 开源模型,基于 Gemini 3 技术,主打高级推理和智能体工作流。提供 E2B、E4B、26B MoE(推理时仅激活 3.8B 参数)和 31B Dense 四种尺寸,31B 在 Arena AI 文本排行榜上位列全球开源模型第 3,采用 Apache 2.0 许可,支持 128K-256K 上下文窗口、原生多模态和 140+ 语言。

    推荐理由:原文给出了四个尺寸、基准排名和部署细节,读者可以据此判断在本地和端侧硬件上的可用性。

4月2日周四
  1. Hugging Face Blog82

    Google DeepMind 发布 Gemma 4 多模态模型系列并登陆 Hugging Face

    Google DeepMind 发布 Gemma 4 多模态模型系列,共五个尺寸(E2B、E4B、12B Unified、31B、26B A4B MoE),采用 Apache 2.0 许可,支持图像、文本和音频输入,上下文窗口最高 256K。

    推荐理由:Hugging Face 官方详解 Gemma 4 架构、多模态能力与全生态部署方式,还覆盖 DiffusionGemma 和推理加速等上手细节。

4月1日周三
  1. Hugging Face Blog62

    TII 发布 Falcon Perception 0.6B 早融合感知模型及 0.3B Falcon OCR

    TII Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早融合 Transformer,用混合注意力掩码处理图像块与文本,做自然语言提示的开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1(SAM 3 为 62.3),但在 presence calibration 上落后(MCC 0.64 vs 0.82)。

    推荐理由:TII 自述用单一早融合 Transformer 做开放词汇感知,读者可以看到架构、数据配方和 SA-Co 与 PBench 上的具体对比依据。

3月31日周二
3月26日周四
  1. Google DeepMind66

    Google DeepMind 发布 Gemini 3.1 Flash Live 语音模型

    Google DeepMind 发布实时语音模型 Gemini 3.1 Flash Live,称其为迄今最高质量的音频模型,延迟更低、对话更自然。在 ComplexFuncBench Audio 上得分 90.8%,在开启 thinking 的 Scale AI Audio MultiChallenge 上得分 36.1%,均领先前代模型。

    推荐理由:官方给出两项音频基准分数和多产品开放入口,读者可以据此评估它对语音智能体开发的实际改进。

3月24日周二
  1. Mistral AI62

    Mistral AI 发布 Voxtral TTS 语音生成模型

    Mistral AI 发布首款文生语音模型 Voxtral TTS,4B 参数,支持 9 种语言,仅需约 3 秒参考音频即可适配自定义音色,并支持零样本跨语言音色迁移。

    推荐理由:原文给出 9 语言、3 秒参考音色、70ms 延迟等可核验细节与人类评测对比,读者可据此评估其语音智能体方案。

3月17日周二
3月7日周六
  1. Google Research50

    谷歌开源模型 SpeciesNet 如何识别野生动物相机陷阱影像

    Google 开发的开源 AI 模型 SpeciesNet 可对相机陷阱图像中约 2,500 类(2,498 类)动物进行分类,训练数据超过 6500 万张标注图像。模型在留出测试集上能找出 99.4% 含动物的图像,可识别到物种级的预测中 94.5% 正确,标准笔记本每天约可处理 3 万张图像。过去一年,全球研究团队已用它在坦桑尼亚塞伦盖蒂、哥伦比亚、澳大利亚等地分析数百万张野生动物影像。

3月5日周四
  1. OpenAI News79

    OpenAI 发布 GPT-5.4:面向专业工作的前沿模型

    OpenAI 发布 GPT-5.4,称其为面向专业工作最强、最高效的前沿模型。新模型在编码、计算机使用和工具搜索上达到 SOTA,并提供 1M-token 上下文窗口。

    推荐理由:OpenAI 官方给出 GPT-5.4 的能力定位与 1M-token 上下文,可据此判断其在专业工作场景中的可用性。

3月4日周三
2月20日周五
2月13日周五
  1. OpenAI News65

    GPT-5.2 推导出理论物理新结果

    OpenAI 发布预印本,显示 GPT-5.2 提出了一个新的 gluon amplitude(胶子振幅)公式,该公式随后由 OpenAI 与学术合作者正式证明和验证。

    推荐理由:模型提出的新物理公式经学术合作者证明与验证,可作为前沿模型科研能力的具体例证。

2月12日周四
  1. OpenAI News62

    OpenAI 发布实时编码模型 GPT-5.3-Codex-Spark

    OpenAI 发布首个实时编码模型 GPT-5.3-Codex-Spark,生成速度提升 15x,支持 128k 上下文。模型以研究预览形式向 ChatGPT Pro 用户开放。

    推荐理由:OpenAI 官方公布实时编码模型的速度与上下文规格及试用范围,正在用该模型的用户可据此评估是否切换。

2月10日周二
  1. Google DeepMind80

    Google DeepMind 发布两篇论文,展示 Gemini Deep Think 在数学与科学研究中的应用

    Google DeepMind 发布两篇论文,介绍 Gemini Deep Think 在专家指导下解决数学、物理和计算机科学的专业研究问题。其数学研究智能体 Aletheia 配备自然语言验证器并可承认失败,在 IMO-ProofBench Advanced 上最高得分 90%,并自主解决 Bloom's Erdős 猜想数据库中的四个开放问题,包括 Erdős-1051。

    推荐理由:原文给出两篇论文的具体成果和方法细节,读者可以了解 AI 辅助科研的实际边界与协作模式。

2月5日周四
2月4日周三
1月29日周四
1月20日周二
1月16日周五
1月13日周二
1月6日周二
1月5日周一
12月23日周二
12月18日周四
  1. OpenAI News72

    OpenAI 发布 GPT-5.2-Codex 编码模型

    OpenAI 发布 GPT-5.2-Codex,称其为目前最先进的编码模型。该模型主打长程推理、大规模代码变换和增强的网络安全能力。

    推荐理由:官方说明点出长程推理、大规模代码改造与安全能力三个方向,可作为评估其编码定位的基本参照。

12月17日周三
  1. Mistral AI63

    Mistral 发布 Mistral OCR 3,文档解析胜率较 Mistral OCR 2 达 74%

    Mistral AI 发布 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上对 Mistral OCR 2 的整体胜率为 74%。模型(mistral-ocr-2512)定价 $2/1000 页,Batch-API 半价至 $1/1000 页,输出支持带 HTML 表格重建的 markdown,并可拖拽 PDF/图片解析为文本或结构化 JSON。

    推荐理由:官方给出与上一代的胜率对比、定价和接入方式,读者可以据此评估它在文档解析流程中的成本与适用性。

12月13日周六
  1. Google DeepMind66

    Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio,推出实时语音翻译

    Google DeepMind 发布面向实时语音 Agent 的更新版 Gemini 2.5 Flash Native Audio,提升函数调用、指令遵循与多轮对话能力,在 ComplexFuncBench Audio 上得分 71.5%,开发者指令遵循率从 84% 升至 90%。

    推荐理由:官方给出了函数调用、指令遵循的具体提升数据和落地入口,读者可以据此评估现有语音 Agent 是否值得升级。

12月11日周四
  1. OpenAI News67

    OpenAI 发布 GPT-5.2,在 GPQA Diamond 与 FrontierMath 上刷新纪录

    OpenAI 发布 GPT-5.2,称其为迄今数学和科学能力最强的模型,在 GPQA Diamond 和 FrontierMath 等基准上创下新的 SOTA 成绩。文章展示了这些能力提升如何转化为实际研究进展,包括解决一个开放理论问题和生成可靠的数学证明。

    推荐理由:原文给出 GPT-5.2 在数学与科学基准上的成绩及其在真实研究中的应用,适合想了解模型推理能力边界的读者。