Thinking Machines 发布万亿参数开源多模态模型 Inkling 及 Inkling-Small
Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总参数 975B、激活 41B 的 MoE 架构,原生接受图像、文本和音频输入,支持 1M 上下文窗口,训练数据为 45 万亿 token。
推荐理由:原文给出架构细节、各档位 VRAM 部署配置和多模态评测数据,对评估落地成本和选择变体有直接参考。
Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总参数 975B、激活 41B 的 MoE 架构,原生接受图像、文本和音频输入,支持 1M 上下文窗口,训练数据为 45 万亿 token。
推荐理由:原文给出架构细节、各档位 VRAM 部署配置和多模态评测数据,对评估落地成本和选择变体有直接参考。
OpenAI 推出 GPT-5.6,主打更高智能与更强性价比:每个 token 产出更多智能,每美元获得更强性能,并按需提供更强能力以应对最难的工作。
Mistral AI 发布首款具身导航模型 Robostral Navigate,8B 参数,仅用单个 RGB 相机加自然语言指令即可自主导航,R2R-CE validation unseen 成功率 76.6%,validation seen 为 79.4%,比最佳单相机方案高 9.7 分,比最佳深度或多相机系统高 4.5 分。
OpenAI 发布新一代语音模型 GPT-Live,面向更自然的人机交互。该模型现已为 ChatGPT Voice 提供支持。
推荐理由:官方宣布新一代语音模型上线并接入 ChatGPT Voice,读者可据此关注语音交互体验的实际变化。
Mistral 发布 Leanstral 1.5,Apache-2.0 许可,总参数 119B、激活 6B,主打 Lean 4 形式化证明工程。模型饱和 miniF2F,解出 587/672 PutnamBench 问题,在 FATE-H 达 87%、FATE-X 达 34%;经 mid-training、SFT 和 CISPO 强化学习三阶段训练。
推荐理由:原文给出基准成绩、成本对比和真实代码验证案例,读者可以据此评估开源形式化推理模型的实用边界。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)。
推荐理由:官方同时给出两款模型的定价、延迟数字和已知限制,开发者可以直接据此评估是否替换现有图像与视频工作流。
Google Research 发布面向表格数据分类与回归的零样本基础模型 TabFM,将表格预测重构为上下文学习问题,免去人工训练、调参和特征工程。
推荐理由:官方介绍了把表格预测重构为上下文学习问题的模型设计、合成数据训练方式和 TabArena 基准结果,读者可据此评估其对传统表格机器学习流程的影响。
OpenAI 预览下一代模型 GPT-5.6 Sol,在编程、科学和网络安全方面能力更强。该模型同时配备了 OpenAI 迄今最先进的安全栈。
Mistral 发布 Mistral OCR 4,除文本外返回边界框、分类型块(标题、表格、公式、签名等)和逐页逐词置信度分数,支持 10 个语系下 170 种语言。
推荐理由:官方公布了能力细节、定价和基准方法论,还主动列出自动评测的打分缺陷,读者可据此判断在自己场景中怎么用。
PaddlePaddle 发布 PP-OCRv6,提供 tiny、small、medium 三档模型,参数量从 1.5M 到 34.5M,medium 和 small 档支持 50 种语言。
OpenAI 与 Molecule.one 展示了一个使用 GPT-5.4 的近自主 AI 化学家,成功改进了一项关键的药物合成反应。这一成果推进了药物化学研究。
智谱发布旗舰模型 GLM-5.2,面向长时程任务,首次在稳定的 1M-token 上下文上交付该能力,采用 MIT 开源协议。架构上提出 IndexShare,每 4 层稀疏注意力共享一个 indexer,1M 上下文下每 token FLOPs 降低 2.9 倍,并改进 MTP 层使投机解码接受长度最多提升 20%。
推荐理由:官方技术报告给出 1M 上下文的架构改进和三项长时程基准对比,读者可以借此评估开源模型在真实编码场景的可用性。
Google DeepMind 发布基于文本扩散的开源实验模型 DiffusionGemma,采用 Apache 2.0 协议,权重已在 Hugging Face 上提供。
推荐理由:官方说明了文本扩散模型的架构取舍与适用场景,读者可据此判断它是否适合本地低并发的高吞吐需求。
Google DeepMind 发布 Gemma 4 12B,采用无编码器的统一多模态架构,视觉和音频输入直接进入 LLM backbone,支持原生音频输入。
推荐理由:原文给出了架构细节、内存门槛和许可证等可验证事实,读者可据此评估本地部署多模态模型的可行性。
NVIDIA 发布 Nemotron 3.5 Content Safety,基于 Gemma 3 4B IT 微调,将多模态输入、12 种语言显式训练覆盖、自定义策略执行和可审计推理轨迹统一到一次推理调用中。
Hcompany 发布 Holo3.1 系列 Computer Use 模型,提供 0.8B、4B、9B 和 35B-A3B 四种尺寸。
推荐理由:官方给出各尺寸在 OSWorld 与 AndroidWorld 的量化后表现和部署路径,读者可据此评估本地 Computer Use Agent 的可行性。
JetBrains 发布 Mellum2,一个总参数 12B、每 token 仅激活 2.5B 的开源 Mixture-of-Experts 模型,在自然语言和代码语料上从头训练,采用 Apache 2.0 许可证。
Mistral 发布 Mistral Medium 3.5 公测版,一个 128B 稠密模型,256k 上下文窗口,SWE-Bench Verified 得分 77.6%,以修改版 MIT 许可开放权重,最少可在四块 GPU 上自托管。
推荐理由:官方发布给出基准成绩、定价和开放权重细节,读者可以据此评估其在自托管编码场景的可行性。
OpenAI 宣布其模型解决了有 80 年历史的单位距离问题,推翻了离散几何中的一个重要猜想。官方称这是 AI 驱动数学研究的里程碑。
推荐理由:OpenAI 官方宣布模型在数学研究上解决 80 年悬而未决的问题,可关注其对 AI 驱动数学研究的意义。
Hugging Face 发布 OlmoEarth v1.1,新一代对地观测模型家族,计算成本最高降低 3x,同时在研究基准和合作任务上保持 v1 的性能。效率提升来自减少 token 序列长度:将 Sentinel-2 三个分辨率的 token 合并为单个 token,并通过修改预训练方法避免性能下降。新家族提供 Base、Tiny、Nano 三种规格,权重和训练代码已开放获取。
Google 发布基于 Gemini 的科学研究工具 ERA,可搜索文献、编写和用树搜索优化科学代码,在基因组学、公共卫生、卫星图像、神经科学、时间序列预测和数学等基准上达到专家级表现,论文发表于 Nature。
推荐理由:原文给出 ERA 的树搜索方法、多领域基准结果和五篇应用论文细节,并说明新工具的开放入口,读者可了解它如何用于具体科学问题。
Hugging Face 的 Tom Aarsen 发布 ettin-reranker-v1 系列,含 17M 到 1B 六个 Sentence Transformers CrossEncoder 重排序模型,基于 Ettin ModernBERT 编码器,Apache 2.0 许可,支持最长 8192 token 上下文。
推荐理由:作者公开了六个模型、完整训练脚本和1.43亿条蒸馏数据,并给出与主流reranker的速度和精度对比,便于按规模选型或自行复现训练。
Google DeepMind 发布 Gemini Omni 系列首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成视频,并支持自然语言多轮编辑。
推荐理由:官方说明了视频生成与对话式编辑的具体能力和订阅范围,读者可以据此判断它是否适配现有创作流程。
Google DeepMind 发布 Gemini 3.5 模型系列,首个型号 3.5 Flash 当天全量开放,3.5 Pro 预计下月推出。
推荐理由:官方正文给出具体基准分数、速度对比和开放渠道,读者可据此评估 3.5 Flash 在智能体与编码场景的实用性。
Databricks 在企业 Agent 工作流中采用 GPT-5.5。此前 GPT-5.5 在 OfficeQA Pro 基准上创下新的 SOTA 成绩。
IBM 发布 Granite Embedding Multilingual R2 两款 Apache 2.0 多语言嵌入模型:97M 紧凑版在 MTEB Multilingual Retrieval 得 60.3。
推荐理由:原文给出完整基准数据、训练方法与框架集成示例,读者可按规模和场景直接选型。
OpenAI 在 API 中发布新的 realtime 语音模型,支持推理、翻译和语音转写。官方称这些模型可支撑更自然、更智能的语音体验。
OpenAI 发布 GPT-5.5 Instant,更新 ChatGPT 的默认模型。官方称其回答更智能、更准确,减少模型幻觉,并改进了个性化控制。
IBM Granite 团队发布 Granite 4.1 系列 dense 模型,含 3B、8B、30B 三个规模,在约 15T tokens 上训练,上下文经长文本扩展达 512K,均以 Apache 2.0 许可开源。
推荐理由:原文完整披露了五阶段预训练、SFT 质控和四阶段 RL 的训练配方,8B 稠密模型对标上一代 32B-A9B MoE 的结果也可供选型参考。
NVIDIA 发布 Nemotron 3 Nano Omni(30B-A3B)全模态理解模型,支持文档分析、ASR、长音视频理解和 agentic computer use,并在 Hugging Face 开放 BF16、FP8 和 NVFP4 权重。
推荐理由:原文给出完整基准对比和架构细节,读者可以据此评估它是否值得替换现有的多模态工作流。
DeepSeek 发布 V4,在 Hub 上开源 DeepSeek-V4-Pro(1.6T 总参数 / 49B 激活)和 DeepSeek-V4-Flash(284B 总参数 / 13B 激活)两个 instruct 及对应 base 检查点,均支持 1M token 上下文。
推荐理由:文章拆解了 V4 为长上下文与 Agent 场景做的架构与后训练设计,读者可据此评估开源模型跑长任务的部署成本。
OpenAI 发布了 GPT-5.5 的 System Card(系统卡)。本次抓取仅获取到标题,正文内容缺失,具体模型能力与安全评估信息以原文链接为准:https://openai.com/index/gpt-5-5-system-card
OpenAI 发布 GPT-5.5,面向编程、研究和数据分析等复杂任务,支持跨工具使用。
OpenAI 发布 Privacy Filter,一个开放权重(open-weight)模型,用于检测并脱敏文本中的个人身份信息(PII),准确率达到当前最先进水平。
OpenAI 发布前沿推理模型 GPT-Rosalind,专为加速药物研发、基因组学分析、蛋白质推理和科研工作流而构建。该模型面向生命科学研究场景,旨在提升相关科研工作的效率。
Google DeepMind 推出文本转语音模型 Gemini 3.1 Flash TTS,在 Artificial Analysis TTS 排行榜获得 Elo 1,211 分,支持原生多说话人对话和 70+ 种语言。
推荐理由:官方发布新 TTS 模型,给出 Elo 分数、多说话人和音频标签等具体能力与开放入口,便于评估语音应用场景。
Google DeepMind 发布 Gemini Robotics-ER 1.6,面向机器人的具身推理模型,在指向、计数、成功检测等空间与物理推理上较 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 明显提升,并新增仪表读取能力,可解读压力表和视镜。
Overworld 发布实时视频世界模型 Waypoint-1.5,权重已上传 Hugging Face。在 RTX 3090 至 5090 桌面硬件上可实时生成最高 720p、60 FPS 的交互环境,另提供面向游戏笔记本等更广消费级硬件的 360p 档位,Apple Silicon 支持即将推出。
推荐理由:原文给出两档模型的具体硬件门槛、帧率分辨率和约百倍数据训练规模,读者可据此判断自己的设备能否本地运行。
Google DeepMind 发布 Gemma 4 开源模型,基于 Gemini 3 技术,主打高级推理和智能体工作流。提供 E2B、E4B、26B MoE(推理时仅激活 3.8B 参数)和 31B Dense 四种尺寸,31B 在 Arena AI 文本排行榜上位列全球开源模型第 3,采用 Apache 2.0 许可,支持 128K-256K 上下文窗口、原生多模态和 140+ 语言。
推荐理由:原文给出了四个尺寸、基准排名和部署细节,读者可以据此判断在本地和端侧硬件上的可用性。
Google DeepMind 发布 Gemma 4 多模态模型系列,共五个尺寸(E2B、E4B、12B Unified、31B、26B A4B MoE),采用 Apache 2.0 许可,支持图像、文本和音频输入,上下文窗口最高 256K。
推荐理由:Hugging Face 官方详解 Gemma 4 架构、多模态能力与全生态部署方式,还覆盖 DiffusionGemma 和推理加速等上手细节。