Google DeepMind 发布 Gemini 4 Argon,输出上限达 1M token
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,宣称在 19 项基准中的 13 项排名第一,输出上限从 64K 提升至 1M(通过 Long Decode Continuation 实现)。
推荐理由:汇总了 Gemini 4 Argon 的基准成绩、定价与获取限制,并保留独立评测和质疑声音,读者可据此平衡官方宣传。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,宣称在 19 项基准中的 13 项排名第一,输出上限从 64K 提升至 1M(通过 Long Decode Continuation 实现)。
推荐理由:汇总了 Gemini 4 Argon 的基准成绩、定价与获取限制,并保留独立评测和质疑声音,读者可据此平衡官方宣传。
Google 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind 计划向可信网络防御者和内部团队开放,再逐步向开发者、企业和消费者开放,暂未给出日期。
推荐理由:文章汇总独立评测、定价和灰度策略,显示 Argon 缩小与头部差距但在 token 效率上仍有代价。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络防御者开放,后续面向开发者、企业和消费者推出。
推荐理由:官方公布的能力、价格与安全机制信息完整,读者可以据此判断 Gemini 4 Argon 在编码、知识工作和网防上的实际变化。
OpenAI 在 DevDay 2026 发布常驻智能体 Dots(由 GPT-6 Astra 驱动,连接 4000+ 应用)、GPT-6.1 Sol(价格约为 Astra 的 1/5。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,作为 GPT-6 Sol 的重大升级,面向智能体编码、计算机使用和专业工作负载提供更强推理。
推荐理由:官方公告给出 GPT-6.1 Sol 上架 Bedrock 后的代理编码、成本对比与数据安全控制,读者可评估生产部署的可行性。
Simon Willison 在旧金山 Fort Mason 现场直播 OpenAI DevDay 2026。
推荐理由:作者亲历现场并记录了演示翻车等一手细节,可以补充发布会通稿之外的现场视角。
OpenAI DevDay 2026 带来超过 20 项发布,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全能力以及面向开发者的新工具。
OpenAI 发布 GPT-6.1 Sol,面向编码、计算机操作和专业工作,提供接近 Astra 的智能水平,标准 API 输入与输出 token 价格为 Astra 的五分之一。
推荐理由:官方宣布 GPT-6.1 Sol 以约五分之一的价格提供接近 Astra 的能力,读者可据此评估编码与办公场景的成本取舍。
AMD 以 82 亿美元收购 World Labs,后者近期发布的 Atlas 是从零训练的全模态架构,能从 2D 图像输入预测下一个视角,结合生成模型与多视角几何解决了计算机视觉中长期的稀疏重建问题,应用于机器人、设计与工程等领域。
Claude Opus 5.5 本周发布,社区反响热烈,尤其被认为擅长制作解释视频。它在 SimpleBench 上以 88.4% 领跑,视觉评测被评为 Anthropic 迄今最佳视觉模型,成本比 Fable 5.1 低约 60%。此外,GPT-6 系列、Gemini 3.8 Flash、小米 MiMo-V2.6-Pro(MIT 开源、1M 上下文)等同周亮相。
Latent Space 发布与 Anthropic 的 Thariq Shihipar 的访谈,讨论 Claude Code 的演进方向,包括 Ask User Question、artifacts 持久化界面、Claude Tag 与 Projects 的多智能体协作、Claude Mods 对执行循环和 UI 的自定义,以及可变软件范式。
Anthropic 发布 Claude Sonnet 5.5,官方称速度提升 30% 以上、多数工作成本降低最多 30%,定价与 Sonnet 5 相同但在各基准上更优。
AWS 宣布 Claude Sonnet 5.5 可在 Amazon Bedrock 和 Claude Platform on AWS(北美)使用,大多数任务成本更低、速度更快。
推荐理由:原文给出 Claude Sonnet 5.5 在 Amazon Bedrock 的接入方式、适用场景与 Opus 5.5 分工建议,读者可据此规划云端部署与成本。
Simon Willison 在 WeAreDevelopers World Congress North America 闭幕演讲中按时间线梳理了 2026 年至今的 LLM 进展,讲稿与注释幻灯片和视频一并公开。
Simon Willison 在 WeAreDevelopers World Congress North America 闭幕演讲前,用三张鸮鹦鹉照片和一段提示词让 Claude Opus 5.5 生成了 HTML5 canvas 像素风鸮鹦鹉派对动画页面。
GitHub Copilot app 的 canvases 功能让用户用 /create-canvas 技能以自然语言描述生成看板、清单等自定义界面,无需编码。画布是双向共享的,用户和 Agent 可同时操作并实时同步状态,创建后可作为扩展保存供个人或团队复用,社区还通过 Awesome Copilot 提供了现成的 canvas 扩展。
Latent Space 主笔 swyx 宣布 AINews v3 计划,将合并 Discord 与 AINews 的功能、探索迁移至 Beehiiv,并重新开放赞助(business@latent.space)与 PR/tips 投稿。
Simon Willison 表示,使用编程智能体(coding agents)越多,越让他确信它们让软件工程变得更难。他认为这些工具确实能完成惊人的工作,但要释放其全部潜力,需要极高的纪律性和知识储备。
Simon Willison 于 2026 年 9 月 24 日发布了关于 commit-rewriter 0.2 的短讯。正文未提供更多功能或版本细节。
聊天仍是与 LLM 交互的主要方式,但作者认为在多数场景下 chat 并非合适的 UI。GitHub Copilot app 中的 canvas 是一个可与 agent 双向通信的全栈小应用,既能调用第三方 API,也能在本地执行代码,文中演示了用它玩 Connect 4、管理 Winget 包、操作 SQLite 数据库以及自动化开发工作流。
GitHub Security Lab 的 Antonio Morales 发布开源 Fuzzing Taskflow,基于 Taskflow Agent 为 C/C++ 项目提供自主模糊测试流水线。
推荐理由:作者亲述设计取舍,读者可以照着跑起来,并理解 LLM 智能体如何接管模糊测试中重复的人工环节。
GitHub 团队在 GitHub Copilot 应用中重建了 pull request 视图,以支持超大规模 diff 的流畅浏览。他们测试了一个含 2200 个文件、超过一百万行变更和 400 多条行内评论的开源 PR,通过将高度拆分为确定性代码几何与动态块几何两套体系,解决了评论高度只有渲染后才能测量的问题。团队还定义了健康指标并持续进行自动化测量与改进循环。
这是一份通过交互式示例讲解 shadow DOM 的教程,演示了样式封装、继承、slots、parts 以及 JavaScript 访问等机制。Shadow roots 会创建隔离的 DOM 树,拥有私有样式表,其元素以特定且受控的方式与页面 DOM 交互。该示例 artifact 由 Fable 5.1 Medium 根据一段提示词构建。
Simon Willison 与 Jesse Vincent 将于 10 月 14 日(周三)在旧金山合办一场关于 Agentic Engineering 的晚间交流活动,面向用 coding agents 构建有趣项目的人。活动以非正式的 show-and-tell 和开放式对话为主,鼓励分享尚未公开的实验和未完成项目,不要求演讲,也不接受产品推销。
Anthropic 于 9 月 22 日发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,掀起价格战。
推荐理由:作者第一时间用同一套 pelican 测试实测三家新模型,并整理了完整价格对照表,读者可据此比较各家定价与实际表现。
voxium 自述入职一家大公司半月,发现规格、代码、测试、PRD、工单等全部由 Claude Code 生成,从 L1 到 L7 的工程师都在做同样的事:与 Claude 对话后按回车。团队成员每天工作 12 到 13 小时却没人真正阅读内容,管理层还认为推代码不是瓶颈,没人喜欢这种状态。
GitHub Podcast 最新一期逐条拆解五个常见 AI 观点:AI 生成代码仍需人工审查,但注意力应放在高风险处;Skills 与 MCP 解决不同问题,前者提供打包的专业知识、后者提供工具与数据接入标准,二者可组合使用;RAG 也没有死,好的检索能让模型更接近答案,与 Agent、skills、MAG 等可共存于同一工作流。
GitHub 用 Copilot agent 将 Copilot agent runtime 从 TypeScript 完整重写为 832,378 行生产 Rust,AI 编写了大部分代码,历时约 14.5 周、128 个 PR,采用原地逐组件替换而非一次性切换,性能有数量级提升。
推荐理由:一手复盘给出原地迁移策略、缓存命中率与子会话协作细节,对规划大规模 agent 辅助重写有可借鉴方法。
GitHub Copilot app 新增 diff、terminal 和 browser 三个内置面板,让用户在不离开应用的情况下审查 AI 智能体的代码改动、运行命令并预览效果。
Mistral 帮助一家欧洲能源运营商把 40 万行 Fortran 77 油藏模拟器中的首期 4 万行迁移到 C++,先搭建数值对齐校验框架导出 Fortran 状态并用 C++ 测试框架验证。
GitHub 推出 Project HydraFusion 研究预览,通过运行时多模型编排提供前沿级编码智能,所有 GitHub Copilot 计划用户可在 Copilot CLI 中通过 /experimental 使用,按各模型标准费率计费。
推荐理由:原文给出三种执行模式和跨基准的成本质量数据,读者可以据此判断多模型编排对编码工作流的实际取舍。
GitHub Copilot app 支持同时运行多个 AI 智能体,各会话相互独立、互不干扰。每个会话可运行在各自的 Git worktree 上并保留独立上下文,并行执行不同任务。开发者可在 sessions 视图跟踪进度,把时间花在审查和决策上,无需逐个等待任务完成。
Hugging Face 发布开源工具 funes,为 Claude Code、Codex、pi、Hermes 等编码智能体提供持久记忆层,基于机器上已有的会话记录构建,本地索引与检索,一条 funes add 命令即可接入。
推荐理由:官方介绍这款本地优先的智能体记忆层,给出了安装方式、检索管线设计和跨机器共享机制,可评估是否纳入自己的编码工作流。
Hugging Face 工程师用 TRL 和 OpenEnv 开源复现了 Surya Narreddi 的项目:训练语言模型写 JavaScript(通过 p5.brush)绘制水彩画。
Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber,称其为迄今最佳推理与编码模型,定价与 3.7 Flash 相同(每百万输入 token $0.75、输出 $3.75)。
推荐理由:官方公布了两个变体的基准数字、定价和 Cyber 版的申请入口,读者可据此评估升级成本与实际收益。
Google DeepMind 发布 Gemini 3.7 Flash,定位为其最智能的编码与智能体主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出了具体基准对比和减半的引入价,读者可以据此评估 Flash 系列在编码和智能体场景的性价比变化。
Microsoft Research 发布开源框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持软件工程、网页导航和个人助理智能体的训练与评估,并可直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练。
推荐理由:开源框架把环境层做成可复用服务,并支持直接在真实部署 harness 中训练,为低成本研究智能体提供了可复用的路径。
IBM Research 与 UC Berkeley Sky Lab 基于开源 K-Search 框架构建结构化 CUDA 到 MLX 翻译层,用演化搜索为 Apple Silicon 生成高质量内核。
UC Berkeley BAIR 团队提出 ABBEL 框架,用自然语言信念状态替代完整交互历史作为 LLM 智能体的工作上下文,并通过 belief grading 监督摘要内容。
Google DeepMind 发布三款 Gemini Flash 系列模型。3.6 Flash 在 Artificial Analysis Index 上输出 token 用量较 3.5 Flash 减少 17%。
推荐理由:原文给出三款 Flash 模型的基准数据、定价和开放入口,读者可以据此评估升级对现有 Agent 工作流成本的影响。