Warp 押注用 GPT-5.5 构建开源开发
Warp 使用 GPT-5.5 及 OpenAI 模型,在本地、云端和开源开发工作流中协调编码智能体。这一举措体现了 Warp 对基于 GPT-5.5 构建开源工具的重点投入。
Warp 使用 GPT-5.5 及 OpenAI 模型,在本地、云端和开源开发工作流中协调编码智能体。这一举措体现了 Warp 对基于 GPT-5.5 构建开源工具的重点投入。
Hugging Face 发布 AI Agent 术语表,解释 agent 领域常被混用的术语,核心区分是模型、脚手架与 harness 三层。
Mistral AI 宣布与 Physics AI 公司 Emmi AI 达成最终收购协议,强化其面向工业企业的 AI 转型服务。Emmi AI 成立于奥地利,团队超过 30 名研究人员和工程师,将加入 Mistral 的 Science 和 Applied AI 团队;其大型工程模型可用于实时仿真替代多天计算和构建数字孪生,并推进 Mistral 的 Science 路线图。
Mistral 发布 Mistral Medium 3.5 公测版,一个 128B 稠密模型,256k 上下文窗口,SWE-Bench Verified 得分 77.6%,以修改版 MIT 许可开放权重,最少可在四块 GPU 上自托管。
推荐理由:官方发布给出基准成绩、定价和开放权重细节,读者可以据此评估其在自托管编码场景的可行性。
Mistral 发布 Studio 中的 Connectors(Public Preview),内置连接器与自定义 MCP 可通过 API/SDK 用于所有模型和 Agent 调用。
OpenAI 入选 2026 年 Gartner 企业级 AI 编程智能体魔力象限领导者(Leader)。Codex 因创新性和企业级规模部署能力获得认可。
Google 发布基于 Gemini 的科学研究工具 ERA,可搜索文献、编写和用树搜索优化科学代码,在基因组学、公共卫生、卫星图像、神经科学、时间序列预测和数学等基准上达到专家级表现,论文发表于 Nature。
推荐理由:原文给出 ERA 的树搜索方法、多领域基准结果和五篇应用论文细节,并说明新工具的开放入口,读者可了解它如何用于具体科学问题。
Google DeepMind 介绍科学家 Omar Abudayyeh 与 Jonathan Gootenberg 实验室用 Co-Scientist 加速抗衰老基因研究。该系统扫描数万篇论文提出 20 多个可测试的新遗传因子,部分经实验验证能推动细胞脱离衰老状态、功能改善;原先需约六个月的筛选数据分析被缩短到几天。
OpenAI 与 Dell 达成合作,将 Codex 引入混合部署与本地部署环境,帮助企业安全地在自有数据和工作流中部署 AI 编程智能体。
Google DeepMind 在 Project Genie 中推出 Street View 街景落地能力,用户可选美国地点并套用 Ocean World、B&W film 等风格生成可交互世界,底层由 Maps Imagery Grounding 支撑。
Google 发布 Gemini for Science,包含 Google Labs 上三个实验性工具和 Google Antigravity 中的 Science Skills。
Google DeepMind 发布 Gemini 3.5 模型系列,首个型号 3.5 Flash 当天全量开放,3.5 Pro 预计下月推出。
推荐理由:官方正文给出具体基准分数、速度对比和开放渠道,读者可据此评估 3.5 Flash 在智能体与编码场景的实用性。
Databricks 在企业 Agent 工作流中采用 GPT-5.5。此前 GPT-5.5 在 OfficeQA Pro 基准上创下新的 SOTA 成绩。
Sea Limited 的 CPO 阐述了公司为何在工程团队中部署 Codex,以加速亚洲 AI 原生软件开发。文章讨论了 Sea 对智能体软件开发未来的看法。
OpenAI 宣布 Codex 可在 ChatGPT 手机应用中使用,支持随时处理编码任务。用户可以在移动设备与远程环境中实时监控、调整和批准编码任务。
OpenAI 构建了一个安全沙箱,使 Codex 能够在 Windows 上运行,并通过受控的文件访问和网络限制来保障安全。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,通过生成、辩论和进化假设迭代产生科研新假设,并通过 Hypothesis Generation 实验工具向个人研究者开放,未来几周开始推出,可在 labs.google/science 注册。
推荐理由:官方发布完整介绍了 Co-Scientist 的多智能体架构、验证机制和多所高校实验室的实际应用结果,还给出了个人研究者注册入口。
德国汽车平台 AutoScout24 使用 OpenAI 的 Codex 与 ChatGPT 加速开发周期、提升代码质量,并扩大 AI 在工程团队中的应用。
OpenAI 介绍其如何在内部安全运行 Codex 编码智能体,做法包括沙箱隔离、审批机制、网络策略和面向 Agent 的遥测,以支持安全合规的编码智能体落地。
Parloa 利用 OpenAI 模型构建可规模化的语音驱动 AI 客服智能体,帮助企业设计、模拟并部署可靠的实时交互服务。该方案让企业能够运行客户愿意与之对话的服务智能体。
Google DeepMind 汇总 Gemini 驱动的编码智能体 AlphaEvolve 一年来的应用成果,并通过 Google Cloud 将其带给商业客户。
推荐理由:官方汇总了 AlphaEvolve 在医疗、电网、数学和商业客户中的具体成果数字,读者可以据此评估这类算法进化智能体的实际落地范围。
OpenAI 的 B2B Signals 研究显示,前沿企业正在深化 AI 采用、扩展基于 Codex 的智能体工作流,并由此构建可持续的竞争优势。
OpenAI 与 PwC 达成合作,帮助企业使用 AI 智能体自动化财务工作流、改进预测并强化内部控制。此次合作旨在推动 CFO 职能的现代化转型。
Google Research 介绍自 9 月预印本发布 Empirical Research Assistance(ERA)以来,其科学家与学术合作者将其应用于真实科研的四个成果。
推荐理由:文章展示了 ERA 在疫情预测、宇宙学、气候遥感和神经回路四个真实科研场景的应用结果,可了解 LLM 辅助科研的具体形态。
NVIDIA 发布 Nemotron 3 Nano Omni(30B-A3B)全模态理解模型,支持文档分析、ASR、长音视频理解和 agentic computer use,并在 Hugging Face 开放 BF16、FP8 和 NVFP4 权重。
推荐理由:原文给出完整基准对比和架构细节,读者可以据此评估它是否值得替换现有的多模态工作流。
Mistral AI 发布 Workflows 公开预览版,这是构建于 Studio 之上的企业 AI 编排层,提供持久执行、可观测性和人在环节点审批,帮助 AI 流程从概念验证走向生产环境。
OpenAI 本周在 Hub 上开源发布 Privacy Filter,一个 PII 检测模型,1.5B 参数、50M 激活参数,Apache 2.0 许可,支持 128k 上下文单次前向识别 8 类个人信息,在 PII-Masking-300k 基准上达到 SOTA。
OpenAI 推出 Symphony,一个面向 Codex 编排的开源规范,可将 issue 跟踪器转化为始终运行的智能体系统。该规范旨在提升工程产出并减少上下文切换。
食品分销公司 Choco 使用 OpenAI API 构建 AI 智能体,实现食品分销流程自动化。该方案帮助 Choco 提升了生产力并释放增长空间,是 AI 在实际业务中落地应用的客户案例。
DeepSeek 发布 V4,在 Hub 上开源 DeepSeek-V4-Pro(1.6T 总参数 / 49B 激活)和 DeepSeek-V4-Flash(284B 总参数 / 13B 激活)两个 instruct 及对应 base 检查点,均支持 1M token 上下文。
推荐理由:文章拆解了 V4 为长上下文与 Agent 场景做的架构与后训练设计,读者可据此评估开源模型跑长任务的部署成本。
ChatGPT Work 提供面向日常工作的实用工作流,覆盖重复性任务、更新汇报、调研、规划以及团队协作运营等场景,帮助用户将这些常见工作环节交给 ChatGPT 处理。
Hugging Face 发布教程,指导开发者在 Manifest V3 约束下用 Transformers.js 在 Chrome 扩展中运行本地 AI,并复刻其 Gemma 4 Browser Assistant 架构。
推荐理由:作者基于自家 Gemma 4 浏览器扩展拆解 MV3 下运行 Transformers.js 的架构决策,给出可直接迁移的运行时划分与消息契约设计。
OpenAI 深入解析了 Codex 智能体循环,展示如何在 Responses API 中用 WebSocket 和连接级缓存降低 API 开销、改善模型延迟。文中说明了 WebSocket 连接复用如何为智能体工作流提速。该能力通过 Responses API 提供。
OpenAI 在 ChatGPT 中推出 workspace agents,这是由 Codex 驱动的智能体,可自动化复杂工作流并在云端运行。该功能面向团队,帮助团队安全地跨工具扩展工作。
OpenAI 介绍如何在 ChatGPT 中构建和使用工作区智能体(workspace agents),用于自动化可重复的工作流。这些智能体可连接各类工具,简化团队运营流程。
Google Research 在 ICLR 论文中提出 ReasoningBank,一个从成功与失败经验中提炼结构化推理记忆的智能体框架,并开源了代码。它以检索、提取、整合的闭环运行,把失败案例转化为预防性经验;配合记忆感知的测试时扩展(MaTTS)进一步提效。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte 和 McKinsey 合作,帮助企业规模化采用前沿 AI。
Hugging Face 发文分析网络安全进入 AI 加速时代后的格局,认为关键在于模型所嵌入的系统而非模型本身,开放生态可在检测、验证、协调、补丁四个阶段分散风险、缩小攻防能力差距。文章主张防御方采用半自主 AI 智能体,配合开源安全工具在组织内部署,并保留人类审批与可审计的决策日志。
推荐理由:原文从 Mythos 出发分析开放生态为何是防御方的结构性优势,并给出半自主智能体的可行防御路线。
Berkeley AI Research 提出 GRASP,一种基于梯度的世界模型规划器,让长时程规划更稳定可靠。其核心做法有三点:把轨迹提升到虚拟状态使优化在时间上并行、在状态迭代中直接引入随机性以实现探索、重塑梯度让动作获得干净的信号并避开脆弱的“状态-输入”梯度。
OpenAI 更新 macOS 和 Windows 版 Codex 应用,新增 computer use、应用内浏览、图像生成、记忆和插件功能,用于加速开发者工作流。
推荐理由:原文点出 Codex 桌面端新增的多项能力,开发者可据此评估是否将其纳入日常工作流。