DeepSeek 开源华为昇腾芯片编程工具,TileLang 成核心
DeepSeek 与华为合作,开源了面向昇腾芯片的编程工具,核心是源自北京大学的 TileLang 语言,DeepSeek 称其比 CUDA 编程模型更简单,并已用约一年、现为公司 AGI 工作的主要工具。
DeepSeek 与华为合作,开源了面向昇腾芯片的编程工具,核心是源自北京大学的 TileLang 语言,DeepSeek 称其比 CUDA 编程模型更简单,并已用约一年、现为公司 AGI 工作的主要工具。
AWS 发布开源决策模型 Strands Decider 2B,灵感来自 TypeSafe 的 Jev,可在预设选项间快速排序并输出置信度,小到可本地运行。该模型基于 Qen3.5-2B 的"躯干"构建,由杰出工程师 Marc Brooker 的业余项目演化而来,曾登上 Jevbench 同规模模型榜首;他称其能借助置信度和封闭答案域为 Agent 工作流提供更低延迟、更低成本且更可靠的步骤决策。
AllenAI 发布开源训练框架 Olmo-core 3, redesigned MoE 训练系统,目标是将 MoE 训练扩展到万亿参数规模。基准测试显示,在 512 块 NVIDIA B300 GPU 上运行 1.2 万亿总参数模型达到 858 TFLOP/s/GPU,新栈比旧 FSDP 实现吞吐高约 2.7 倍;MXFP8 使吞吐比 BF16 提高约 21%。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评估开源、多语言的 TTS 模型和声音克隆能力。评估采用 Qwen3 ASR 计算的 WER/CER 衡量可懂度、H200 GPU 上的 RTFx 与 TTFA 衡量速度、WavLM 嵌入余弦相似度衡量说话人相似度,使单个模型评估从数周缩短到数小时。
NVIDIA 发布开源表格基础模型 Kumo Tabular,对带标签的表格数据在单次前向传播中完成分类或回归预测,无需训练、调参或特征工程。
推荐理由:官方发布开放表格基础模型,用上下文学习免训练预测,作者给出了架构细节和基准表现,读者可以评估它是否适合替换现有梯度提升树流程。
Claude Opus 5.5 本周发布,社区反响热烈,尤其被认为擅长制作解释视频。它在 SimpleBench 上以 88.4% 领跑,视觉评测被评为 Anthropic 迄今最佳视觉模型,成本比 Fable 5.1 低约 60%。此外,GPT-6 系列、Gemini 3.8 Flash、小米 MiMo-V2.6-Pro(MIT 开源、1M 上下文)等同周亮相。
Hcompany 发布 Holo4 智能体系列模型,含 27B dense 和 35B-A3B MoE 两个尺寸,并更新发布 Holotron4 Nano。模型可通过 GUI、代码、MCP 和 API 多种接口操作软件,在 OSWorld 2.0 上 Holo4 27B 得分 61.7%(Opus 5.5 为 81.8%),35B-A3B 达 30.9%,参数量和成本显著更低。
推荐理由:原文给出 OSWorld 2.0 等基准分数、成本对比和全部轨迹开源信息,读者可以据此评估这款多接口智能体模型是否适配自己的业务工作流。
Liquid AI 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下换取加速。
推荐理由:原文给出视觉 DSpark 草稿模型的架构细节、实测加速数字和三大推理框架接入方式,读者可评估端侧 VLM 推理加速的可迁移做法。
NVIDIA 于 9 月 22-23 日在新加坡举办 AI Day,与合作伙伴展示东南亚地区的 AI 进展。
Simon Willison 于 9 月 22 日发布了 LLM 工具的 0.36 版本。原文仅提供发布信息,未说明具体更新内容。
NVIDIA 在多伦多 ROSCon 大会上发布 Isaac ROS 5.0,新增面向智能体的工作流、Isaac skills 和对 ROS Lyrical 与 Ubuntu 24.04 的支持。
oMLX 的创建者和维护者 Jun Kim 加入 Hugging Face,将把 oMLX 从副业转变为获得完全维护和资金支持的项目,oMLX 仍保持 Apache 2.0 开源并由 Jun 继续领导。
Hugging Face 宣布 transformers 支持通过 from_pretrained 直接加载 GGUF 量化模型,复用 ggml 的 Metal 内核以接近 llama.cpp 的性能。
推荐理由:官方介绍 transformers 直接加载 GGUF 的用法、量化选择和与 llama.cpp 的对比数据,对想在 Mac 上本地推理的开发者有实用参考。
埃及 AI 生态活动在 Grand Egyptian Museum 举行,NVIDIA EMEA 副总裁 Paolo Guglielmini 发表主题演讲,埃及的 NVIDIA Deep Learning Institute 学习者规模一年内增长超十倍。
Hugging Face 发布 tokenizers v1 的 release candidate,在 Apple M4 Max 单线程上编码速度比 v0.23 快 3 到 30 倍(低端 t5-base,高端 gpt2),八线程扩展达线性的 76%。
推荐理由:Hugging Face 官方实测数据说明 tokenizers v1 为何能比 v0.23 快 3 到 30 倍,读者可以借此判断升级对训练和推理工作流的影响。
Mistral 与 Mozilla 宣布合作,Firefox Smart Window(beta)AI 浏览助手现由 Mistral 模型驱动,首先面向法国和北美用户,英国和德国预计年内跟进。对话默认不保存在 Mozilla 服务器,Mistral 承诺零数据保留,模型针对地区语言、方言和文化语境做了微调。
IBM Research 在 ALTK-Evolve 中推出 Consistency Analyzer 和一致性指南,针对智能体重复执行同一任务的稳定性问题。
Hugging Face 发布 Workflow1111,用 gr.Workflow 在单个画布上重建了 AUTOMATIC1111 的大部分功能,包含 11 条媒体管线和 73 个节点。
推荐理由:用 73 个节点在单一画布上复刻 AUTOMATIC1111 主要功能,并展示每个输出可直接变成 REST 端点和 MCP 工具的做法。
Mistral 宣布完成 30 亿欧元 Series D 融资,投后估值超 210 亿欧元,称其为欧洲科技公司史上最大股权融资。本轮由三星电子领投,Scaleup Europe Fund(EQT 管理)和 PSG Equity 联合领投,Advent、BlackRock、卢森堡大公国为新投资方,a16z、ASML、NVIDIA 等老股东跟投。
推荐理由:官方公告给出融资金额、估值和资方名单,读者可以据此了解欧洲主权开源模型路线的资金与商业基础。
H Company 发布 NeoMME 系列 260M 和 800M 多语言多模态编码器,用单个双向 Transformer 处理文本和 32×32 图像 patch,从零以掩码离散扩散目标训练,无需独立视觉塔或因果语言模型。
Hugging Face 发布开源工具 funes,为 Claude Code、Codex、pi、Hermes 等编码智能体提供持久记忆层,基于机器上已有的会话记录构建,本地索引与检索,一条 funes add 命令即可接入。
推荐理由:官方介绍这款本地优先的智能体记忆层,给出了安装方式、检索管线设计和跨机器共享机制,可评估是否纳入自己的编码工作流。
Hugging Face 工程师用 TRL 和 OpenEnv 开源复现了 Surya Narreddi 的项目:训练语言模型写 JavaScript(通过 p5.brush)绘制水彩画。
Hugging Face 推出 BenchMIRT,一种基于多维 IRT 的方法,用于在题目层面审计 LLM 基准的真实测量内容。该方法基于 100 个 LLM、16 个基准和超过 34K 道题的结果训练,未事先标注即独立恢复出安全与通用推理两个维度。分析发现 BBQ 和 WMDP 得分与通用推理的关联强于安全,HarmBench 的版权类题目也更偏向通用推理。
Google Research 发布时间序列基础模型 TimesFM-3,参数量 3.3 亿,预训练语料超过 1 万亿时间点,原生支持零样本多变量预测。模型可同时预测多个目标序列,支持过去协变量与过去-未来协变量,通过交替注意力与 Contiguous Patch Masking 在单次前向传播中完成整段预测,每步输出第 10 到第 90 百分位共 9 个分位数。
Microsoft Research 联合华盛顿大学和 Providence 发布 GigaPath-Flash 与 GigaTIME-Flash,以 Apache 2.0 许可在 HuggingFace 开放权重。
Voice Arena 与 Hugging Face 合作,在 Open ASR Leaderboard 引入 Monsoon en-IN 和 Monsoon hi-IN 两套评测集,覆盖 4,888 名说话人,印地语是该多语言榜单上首个非欧洲语言。
推荐理由:原文给出 Monsoon 四个评测集的采集设计与区域误差分析样例,读者可以了解带说话人元数据的 ASR 评测能揭示什么。
IBM 发布 Granite 4.2 推理模型家族,含 3B、8B、30B 三个稠密模型,以 Apache 2.0 许可开源。
推荐理由:IBM 官方公开 Granite 4.2 从预训练到多阶段 RL 的完整训练细节,读者可以借此了解推理模型的可复现构建路径。
Hugging Face 在 Gradio 中推出 gr.Workflow,把 AI 应用的多步骤流水线描述为类型化节点图,并提供可拖拽画布,每个节点可运行、中间结果可见。
推荐理由:原文来自官方,给出 gr.Workflow 的节点图机制、多个可复制的在线示例和 REST API 用法,读者可以直接上手复用这套搭建 AI 流水线的方法。
Mistral 与 HUMAIN 宣布建立战略合作,在沙特阿拉伯及中东地区推进主权 AI,合作规模达数亿欧元,覆盖 AI 基础设施、先进模型开发与 AI 方案部署。双方将开发并本地化先进模型,初期聚焦网络安全与语音,并计划打造阿拉伯语表现优异的前沿模型。两家公司还将探索利用 HUMAIN 数据中心基础设施满足当地算力需求,并在沙特面向受监管行业制定联合市场策略。
Hugging Face 发布教程介绍 Sentence Transformers v6.0 新增的第四种模型类型 MultiVectorEncoder,用于 ColBERT 式 late interaction 检索。
推荐理由:官方教程详解 Sentence Transformers v6.0 新增 MultiVectorEncoder 的用法,涵盖 MaxSim 原理、索引成本与视觉文档检索实践。
DiG-bench 是一个包含 70 款隐藏规则游戏的基准,用于测试 AI 通过探索发现环境规则的能力,来自牛津、Princeton、MIT 等机构,作者包括 Juergen Schmidhuber。
Hugging Face 发布 2026 年 1 至 8 月开源模型生态观察,Hub 公开模型仓库从 243 万增至 296 万,Qwen 衍生模型达 151,448 个,成为社区主要基座模型。
推荐理由:Hugging Face 用 Hub 下载、衍生模型和 Agent 流量等一手数据,刻画 2026 年开源模型生态的结构变化。
Hugging Face 于 7 月 15 日至 8 月 2 日举办 ICML 2026 Open Reproductions 挑战赛,1,221 名社区成员用 Claude Code、Codex、Cursor 等智能体逐条复现论文,19 天内发布 6,816 份 Trackio logbook,覆盖 2,226 篇论文,约占会议的 34%。
推荐理由:原文基于一次大规模复现活动的第一手数据,给出可复现率、证伪案例和人类在 Agent 审稿中的角色判断。
Hugging Face 的 OlmoEarth Studio 现已支持计算并导出 OlmoEarth 开源基础模型的 embedding 向量,用于相似性搜索、分割等下游任务。
Mistral 推出三项主权 AI 举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,提供自定义速率限制和 uptime SLA。
Meta 发布 30B 参数开源多模态模型 Muse Glimmer,从 Muse 蒸馏而来,采用 Apache 2.0 许可,定位于本地智能体场景如编码、文档分析和个人助理。
推荐理由:原文给出架构细节、跑分对比和多套部署方案,读者可据此评估其在本地多模态智能体场景的可用性。
Baseten 正式成为 Hugging Face Hub 支持的 Inference Provider,为 Hub 模型页面增强 serverless 推理能力。初始集成支持对话和文本生成任务,可调用 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开放权重 LLM。用户可设置自己的 API key 直连或经 HF 路由计费,PRO 用户每月获 $2 推理额度。
Mistral 发布 3B 开源多模态安全分类模型 Shieldstral,以 Apache 2.0 权重开放下载。它把内容审核建模为策略自适应的问答任务,推理时用自然语言写入审核政策即可返回校准的安全分数,无需重训练,可统一处理文本、图像及提示-回复对。官方称其在文本安全、拒答检测和多模态审核上匹配或超过最大 7 倍于其体积的开源护栏模型,可在单张 16GB GPU 上运行。
Microsoft Research 发布开源框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持软件工程、网页导航和个人助理智能体的训练与评估,并可直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练。
推荐理由:开源框架把环境层做成可复用服务,并支持直接在真实部署 harness 中训练,为低成本研究智能体提供了可复用的路径。
Hugging Face 宣布 Diffusers 原生支持 Nunchaku 的 SVDQuant 4-bit 推理,通过 Nunchaku Lite 集成路径直接用 from_pretrained() 加载量化 checkpoint,无需独立推理引擎或本地 CUDA 编译。
推荐理由:Diffusers 原生集成 Nunchaku,W4A4 量化在降显存的同时也降低推理延迟,是可复现的部署方案变化。