Google DeepMind 与 A24 宣布首个此类研究合作
Google DeepMind 与 A24 宣布达成首个此类研究合作,围绕多个项目展开长期研发协作,帮助电影人开发新的工作流程与技术。Google 同时对 A24 进行了投资。双方将共同测试、迭代并构建新工具,以拓展未来娱乐创作的可能性。
Google DeepMind 与 A24 宣布达成首个此类研究合作,围绕多个项目展开长期研发协作,帮助电影人开发新的工作流程与技术。Google 同时对 A24 进行了投资。双方将共同测试、迭代并构建新工具,以拓展未来娱乐创作的可能性。
Mistral 发布 Leanstral 1.5,Apache-2.0 许可,总参数 119B、激活 6B,主打 Lean 4 形式化证明工程。模型饱和 miniF2F,解出 587/672 PutnamBench 问题,在 FATE-H 达 87%、FATE-X 达 34%;经 mid-training、SFT 和 CISPO 强化学习三阶段训练。
推荐理由:原文给出基准成绩、成本对比和真实代码验证案例,读者可以据此评估开源形式化推理模型的实用边界。
Berkeley AI Research(BAIR)实验室庆祝 2026 届博士毕业生,研究方向覆盖机器人与具身智能、LLM 推理、生成模型、AI 安全等。
Hugging Face 与 Cerebras 发布开源级联语音到语音管线,语音识别用 Nvidia Parakeet,语言模型为 Google DeepMind Gemma 4 31B 并在 Cerebras 上推理,语音合成用 Qwen3TTS。
Hugging Face 推出开源基准 ScarfBench,用 Spring、Jakarta EE、Quarkus 间的迁移任务评测 AI 智能体,包含 34 个应用、102 个框架实现、204 个迁移任务、约 151K 行代码和 1,331 个专家编写测试。
Google Research 将建筑级屋顶反照率数据扩展至 9 个国家的 50 多座城市,包括伦敦、里约热内卢和纽约,并通过新的高分辨率 Heat Resilience Earth Engine App 开放访问。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)。
推荐理由:官方同时给出两款模型的定价、延迟数字和已知限制,开发者可以直接据此评估是否替换现有图像与视频工作流。
Dharma AI 解读 Goldfeder、Wyder、LeCun 与 Shwartz-Ziv 2026 年的论文《AI Must Embrace Specialization via Superhuman Adaptable Intelligence》,论证专业化是 AI 系统的必然方向。
Google Research 发布面向表格数据分类与回归的零样本基础模型 TabFM,将表格预测重构为上下文学习问题,免去人工训练、调参和特征工程。
推荐理由:官方介绍了把表格预测重构为上下文学习问题的模型设计、合成数据训练方式和 TabArena 基准结果,读者可据此评估其对传统表格机器学习流程的影响。
OpenAI Signals 数据显示 ChatGPT 在全球范围内持续增长,用户使用频率提升,并探索更多功能。增长跨越多个地区和语言。
Hugging Face 宣布 Every Eval Ever(EEE)与 Community Evals 互通,支持交叉发布评测结果并链接完整 EEE 记录,官方账号提交的结果在 EvalEval 显示认证标记。
OpenAI 推出 GeneBench-Pro,一个测试 AI 在基因组学、生物学和科研领域表现的全新基准测试。该基准使用复杂的真实世界数据集来评估 AI 性能。
Hugging Face 团队提出 DiScoFormer,单个 Transformer 模型经一次前向传播即可同时估计任意数据集分布的密度和 score,无需针对新分布重训练。
NVIDIA 研究人员开发 ENPIRE 框架,让物理机器人像编码智能体一样自主实验与迭代改进策略。系统用两台 YAM 机械臂和 RTX 5090 工作站组成闭环,自动评估与重置场景,GPT-5.5(Codex)和 Opus 4.7(Claude Code)表现最佳,在 PushT 等灵巧操作任务上达到 99% 成功率,8 个智能体并行有时获得更高分数。
OpenAI 发布新报告,描绘 AI 如何重塑欧盟就业格局,指出哪些职业可能面临自动化、增长或工作流程变化。
HP Inc. 与 OpenAI 建立 Frontier 战略合作关系,将 AI 部署到客户体验、软件开发和企业运营中。该合作由 HP Inc. 推动扩展,覆盖其核心业务环节。
Google 将 Multi-Token Prediction(MTP)头附加到冻结权重的 Gemini Nano v3 模型上,已面向 Pixel 9 和 10 系列推出,可开箱即用地加速端侧 AI。
OpenAI 预览下一代模型 GPT-5.6 Sol,在编程、科学和网络安全方面能力更强。该模型同时配备了 OpenAI 迄今最先进的安全栈。
Hugging Face 发布教程,用一条 hf jobs run 命令即可在 HF 基础设施上启动私有 OpenAI 兼容的 vLLM 端点,无需配置服务器或 Kubernetes,按秒计费(a10g-large 为 $1.50/hour)。
推荐理由:官方教程给出一条命令在 HF Jobs 上起 vLLM 服务的完整路径,含定价、权限、SSH 调试和接 coding agent 等可复用细节。
Google Research 在 CIDR 发表 linear elastic caching,将缓存页淘汰建模为 ski rental 问题,用轻量级机器学习动态调整缓存大小以最小化 TCO。
OpenAI 发布新研究论文,展示 AI 智能体如何改变工作,让更长、更复杂的任务得以完成,并提升各类岗位的生产力。
Google Research 在 COLM 2026 发表论文,发现开启推理后模型能召回原本无法给出的简单单跳事实,实验覆盖 Gemini-2.5 Flash/Pro 与 Qwen3-32B,使用 SimpleQA Verified 和 EntityQuestions 数据集。
Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,此前该能力仅以独立 Gemini 2.5 computer use 模型提供。
推荐理由:原文说明 computer use 从独立模型转为 Gemini 3.5 Flash 内置工具,并给出 API 入口和企业级安全防护选项。
NVIDIA NeMo AutoModel 构建在 HuggingFace Transformers v5 之上,只需更改一行 import 即可微调 MoE 模型,相比最优的 v5 配置训练吞吐提升 3.4-3.7x、GPU 显存降低 29-32%。
Mistral 推出多项 Connectors 新功能:管理员可按 workspace 或 org 设置连接器访问权限并逐个开关工具,API keys 支持 connector scope 防止自动化任务冒充用户身份,多账号连接器支持一个连接器绑定多个登录账号。
OpenAI 与 Broadcom 发布定制 AI 芯片 Jalapeño,专为 LLM 推理设计,目标是提升 AI 系统的性能、效率与规模。
Treble Technologies 与 Hugging Face 联合推出 FFASR Leaderboard,首个开放的社区驱动远场 ASR 基准,覆盖 14 个模拟房间并与实测数据做了 sim-to-real 验证。
GPT-5 Pro 帮助免疫学家 Derya Unutmaz 破解了一项悬置 3 年的免疫学谜题,揭示了 T 细胞行为的关键机制。这一突破有望支持癌症和自身免疫疾病研究。
OpenAI 支持 Appia Foundation,通过评估框架、安全实践和全球合作推动构建高级 AI 的共享标准。
Mistral 发布 Mistral OCR 4,除文本外返回边界框、分类型块(标题、表格、公式、签名等)和逐页逐词置信度分数,支持 10 个语系下 170 种语言。
推荐理由:官方公布了能力细节、定价和基准方法论,还主动列出自动评测的打分缺陷,读者可据此判断在自己场景中怎么用。
Google Chrome 团队的 Thomas Steiner 在 Transformers.js 中实验了尚处早期提案阶段的 Cross-Origin Storage API。
Hugging Face 在官方博客详解如何把 huggingface_hub 的发布节奏从每 4 到 6 周一次提升到每周一次,整条流程跑在一个 GitHub Actions 工作流里,使用开源工具、开源权重模型(当前为 Z.ai 的 GLM-5.2)和 HF Inference Providers,单次发布的模型成本约 $0.25。
推荐理由:Hugging Face 官方复盘自身发布流水线,给出可复用的确定性校验加人工把关模式,其他开源维护者可以照搬适配。
旅行平台 Omio 使用 OpenAI 构建对话式旅行体验,并加速产品开发。公司正借助 OpenAI 转型为 AI 原生企业。
PaddlePaddle 发布 PP-OCRv6,提供 tiny、small、medium 三档模型,参数量从 1.5M 到 34.5M,medium 和 small 档支持 50 种语言。
本期Import AI汇集三项内容。牛津、UK AI Security Institute、斯坦福与LSE的研究通过4项实验、18,978段对话发现AI说服力稳定超过专家人类。
OpenAI 推出 Daybreak 系列安全工具,包括 Codex Security 和 GPT-5.5-Cyber,帮助各类组织大规模查找、验证并修补漏洞。这些工具面向全球企业的安全防护场景。
OpenAI 推出 Patch the Planet,这是 Daybreak 旗下的一项计划,旨在帮助开源维护者借助 AI 和专家评审来发现、验证并修复安全漏洞。
Jason Liu 分享了使用 OpenAI Codex 处理长时间运行任务的经验。他利用 Codex 保存上下文、管理复杂项目,让工作在单个提示词之外持续进行。
Hugging Face 博客介绍了 localpager 系统,用 pi agent harness 加受限只读 shell reposhell,在 NVIDIA GB10(DGX Spark。
推荐理由:作者分享了本地模型加受限 shell 做高吞吐分类的完整配方,附带 330 条评测对比,可迁移到其他信息过滤场景。
三星电子向全球员工部署 ChatGPT Enterprise 和 Codex,这是 OpenAI 规模最大的企业级 AI 部署之一。