Google DeepMind 发布 Gemini 4 Argon,输出上限扩至 1M tokens
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络防御者开放,后续面向开发者、企业和消费者推出。
推荐理由:官方公布的能力、价格与安全机制信息完整,读者可以据此判断 Gemini 4 Argon 在编码、知识工作和网防上的实际变化。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络防御者开放,后续面向开发者、企业和消费者推出。
推荐理由:官方公布的能力、价格与安全机制信息完整,读者可以据此判断 Gemini 4 Argon 在编码、知识工作和网防上的实际变化。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,作为 GPT-6 Sol 的重大升级,面向智能体编码、计算机使用和专业工作负载提供更强推理。
推荐理由:官方公告给出 GPT-6.1 Sol 上架 Bedrock 后的代理编码、成本对比与数据安全控制,读者可评估生产部署的可行性。
OpenAI DevDay 2026 带来超过 20 项发布,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全能力以及面向开发者的新工具。
OpenAI 发布 GPT-6.1 Sol,面向编码、计算机操作和专业工作,提供接近 Astra 的智能水平,标准 API 输入与输出 token 价格为 Astra 的五分之一。
推荐理由:官方宣布 GPT-6.1 Sol 以约五分之一的价格提供接近 Astra 的能力,读者可据此评估编码与办公场景的成本取舍。
AWS 宣布 Claude Sonnet 5.5 可在 Amazon Bedrock 和 Claude Platform on AWS(北美)使用,大多数任务成本更低、速度更快。
推荐理由:原文给出 Claude Sonnet 5.5 在 Amazon Bedrock 的接入方式、适用场景与 Opus 5.5 分工建议,读者可据此规划云端部署与成本。
GitHub Copilot app 的 canvases 功能让用户用 /create-canvas 技能以自然语言描述生成看板、清单等自定义界面,无需编码。画布是双向共享的,用户和 Agent 可同时操作并实时同步状态,创建后可作为扩展保存供个人或团队复用,社区还通过 Awesome Copilot 提供了现成的 canvas 扩展。
聊天仍是与 LLM 交互的主要方式,但作者认为在多数场景下 chat 并非合适的 UI。GitHub Copilot app 中的 canvas 是一个可与 agent 双向通信的全栈小应用,既能调用第三方 API,也能在本地执行代码,文中演示了用它玩 Connect 4、管理 Winget 包、操作 SQLite 数据库以及自动化开发工作流。
GitHub Security Lab 的 Antonio Morales 发布开源 Fuzzing Taskflow,基于 Taskflow Agent 为 C/C++ 项目提供自主模糊测试流水线。
推荐理由:作者亲述设计取舍,读者可以照着跑起来,并理解 LLM 智能体如何接管模糊测试中重复的人工环节。
GitHub 团队在 GitHub Copilot 应用中重建了 pull request 视图,以支持超大规模 diff 的流畅浏览。他们测试了一个含 2200 个文件、超过一百万行变更和 400 多条行内评论的开源 PR,通过将高度拆分为确定性代码几何与动态块几何两套体系,解决了评论高度只有渲染后才能测量的问题。团队还定义了健康指标并持续进行自动化测量与改进循环。
GitHub Podcast 最新一期逐条拆解五个常见 AI 观点:AI 生成代码仍需人工审查,但注意力应放在高风险处;Skills 与 MCP 解决不同问题,前者提供打包的专业知识、后者提供工具与数据接入标准,二者可组合使用;RAG 也没有死,好的检索能让模型更接近答案,与 Agent、skills、MAG 等可共存于同一工作流。
GitHub 用 Copilot agent 将 Copilot agent runtime 从 TypeScript 完整重写为 832,378 行生产 Rust,AI 编写了大部分代码,历时约 14.5 周、128 个 PR,采用原地逐组件替换而非一次性切换,性能有数量级提升。
推荐理由:一手复盘给出原地迁移策略、缓存命中率与子会话协作细节,对规划大规模 agent 辅助重写有可借鉴方法。
ChatGPT Work 和 Codex analytics 可帮助团队了解 AI 使用与支出情况,识别培训需求,并将 AI 采用与业务成果关联起来,从而把 AI 使用转化为可衡量的业务价值。
GitHub Copilot app 新增 diff、terminal 和 browser 三个内置面板,让用户在不离开应用的情况下审查 AI 智能体的代码改动、运行命令并预览效果。
Mistral 帮助一家欧洲能源运营商把 40 万行 Fortran 77 油藏模拟器中的首期 4 万行迁移到 C++,先搭建数值对齐校验框架导出 Fortran 状态并用 C++ 测试框架验证。
GitHub 推出 Project HydraFusion 研究预览,通过运行时多模型编排提供前沿级编码智能,所有 GitHub Copilot 计划用户可在 Copilot CLI 中通过 /experimental 使用,按各模型标准费率计费。
推荐理由:原文给出三种执行模式和跨基准的成本质量数据,读者可以据此判断多模型编排对编码工作流的实际取舍。
GitHub Copilot app 支持同时运行多个 AI 智能体,各会话相互独立、互不干扰。每个会话可运行在各自的 Git worktree 上并保留独立上下文,并行执行不同任务。开发者可在 sessions 视图跟踪进度,把时间花在审查和决策上,无需逐个等待任务完成。
Hugging Face 发布开源工具 funes,为 Claude Code、Codex、pi、Hermes 等编码智能体提供持久记忆层,基于机器上已有的会话记录构建,本地索引与检索,一条 funes add 命令即可接入。
推荐理由:官方介绍这款本地优先的智能体记忆层,给出了安装方式、检索管线设计和跨机器共享机制,可评估是否纳入自己的编码工作流。
Hugging Face 工程师用 TRL 和 OpenEnv 开源复现了 Surya Narreddi 的项目:训练语言模型写 JavaScript(通过 p5.brush)绘制水彩画。
Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber,称其为迄今最佳推理与编码模型,定价与 3.7 Flash 相同(每百万输入 token $0.75、输出 $3.75)。
推荐理由:官方公布了两个变体的基准数字、定价和 Cyber 版的申请入口,读者可据此评估升级成本与实际收益。
OpenAI 推出面向 ChatGPT Work 和 Codex 的 Admin 插件。管理员可用它分析工作区使用情况、管理成员和权限、调整限额,并处理管理员请求。
GPT‑5.6 现已在 Kiro 中可用,帮助开发者更高效地规划、构建、审查和测试软件,并提供更好的价格性能比。
Google DeepMind 发布 Gemini 3.7 Flash,定位为其最智能的编码与智能体主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出了具体基准对比和减半的引入价,读者可以据此评估 Flash 系列在编码和智能体场景的性价比变化。
Microsoft Research 发布开源框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持软件工程、网页导航和个人助理智能体的训练与评估,并可直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练。
推荐理由:开源框架把环境层做成可复用服务,并支持直接在真实部署 harness 中训练,为低成本研究智能体提供了可复用的路径。
IBM Research 与 UC Berkeley Sky Lab 基于开源 K-Search 框架构建结构化 CUDA 到 MLX 翻译层,用演化搜索为 Apple Silicon 生成高质量内核。
OpenAI 发布的一份领域报告显示,科学家正借助 AI 编程智能体升级科学计算,加速软件开发与科学发现,应用涵盖基因组学等领域。
UC Berkeley BAIR 团队提出 ABBEL 框架,用自然语言信念状态替代完整交互历史作为 LLM 智能体的工作上下文,并通过 belief grading 监督摘要内容。
Google DeepMind 发布三款 Gemini Flash 系列模型。3.6 Flash 在 Artificial Analysis Index 上输出 token 用量较 3.5 Flash 减少 17%。
推荐理由:原文给出三款 Flash 模型的基准数据、定价和开放入口,读者可以据此评估升级对现有 Agent 工作流成本的影响。
Australian Payments Plus(AP+)使用 ChatGPT Enterprise 和 Codex 应对支付业务的复杂性,从而加快工作速度。该公司节省了时间、提升了质量,并保持人工判断处于核心地位。
Hugging Face 推出开源基准 ScarfBench,用 Spring、Jakarta EE、Quarkus 间的迁移任务评测 AI 智能体,包含 34 个应用、102 个框架实现、204 个迁移任务、约 151K 行代码和 1,331 个专家编写测试。
Jason Liu 分享了使用 OpenAI Codex 处理长时间运行任务的经验。他利用 Codex 保存上下文、管理复杂项目,让工作在单个提示词之外持续进行。
Hugging Face 发布 agent-eval 基准工具,不只看最终答案,而是测量智能体完成任务所需的轮次、token、时间和失败情况,全部由开源模型通过 pi 编码智能体驱动并跑在 Hugging Face Jobs 上。
智谱发布旗舰模型 GLM-5.2,面向长时程任务,首次在稳定的 1M-token 上下文上交付该能力,采用 MIT 开源协议。架构上提出 IndexShare,每 4 层稀疏注意力共享一个 indexer,1M 上下文下每 token FLOPs 降低 2.9 倍,并改进 MTP 层使投机解码接受长度最多提升 20%。
推荐理由:官方技术报告给出 1M 上下文的架构改进和三项长时程基准对比,读者可以借此评估开源模型在真实编码场景的可用性。
Hugging Face 发布教程,教你把 GitHub Actions CI 任务改由 HF Jobs 执行,只需将 runs-on 改为 hf-jobs-* 标签,通过 dispatcher Space 和 GitHub App 桥接即可。
推荐理由:Hugging Face 官方给出把 GitHub Actions CI 迁到 HF Jobs 的完整步骤,并用 Trackio 实测数据说明 CPU 提速约 30% 和低成本 GPU CI 的可行路径。
Endava 正在利用 AI 智能体、ChatGPT Enterprise 和 Codex 加速软件交付,并自动化工作流程。该公司同时在整个企业范围内建设 AI 原生文化,推动 AI 融入日常研发与业务流程。
Wasmer 使用 Codex(配合 GPT-5.5)构建了一个面向边缘环境的 Node.js 运行时。该方案将开发速度提升 10x 到 20x,原本需要数月的交付缩短至数周。
OpenAI 推出 ChatGPT Sites,用户可以用 Codex 创建轻量级网站或应用。目前公开信息有限,该功能的核心用途即通过 Codex 生成这类轻量网页内容。
OpenAI 推出 Codex 插件、站点和标注功能,帮助分析师、营销人员、设计师和投资人等不同团队更高效地用 AI 完成工作。这些新能力让 Codex 覆盖更多角色与工作流场景。
OpenAI 发布《The Next Era of Knowledge Work》报告,探讨 Codex 如何通过 AI 驱动的研究、数据分析、工作流自动化和内容创作来变革生产力。报告指出 Codex 正在成为面向所有人的生产力工具。
JetBrains 发布 Mellum2,一个总参数 12B、每 token 仅激活 2.5B 的开源 Mixture-of-Experts 模型,在自然语言和代码语料上从头训练,采用 Apache 2.0 许可证。
Braintrust 工程师使用 Codex 与 GPT-5.5 将客户需求转化为代码。借助这一组合,团队能够更快地运行实验和编写代码。