Google DeepMind 发布 Gemini 3.5,首发 3.5 Flash
Google DeepMind 发布 Gemini 3.5 模型系列,首个型号 3.5 Flash 当天全量开放,3.5 Pro 预计下月推出。
推荐理由:官方正文给出具体基准分数、速度对比和开放渠道,读者可据此评估 3.5 Flash 在智能体与编码场景的实用性。
Google DeepMind 发布 Gemini 3.5 模型系列,首个型号 3.5 Flash 当天全量开放,3.5 Pro 预计下月推出。
推荐理由:官方正文给出具体基准分数、速度对比和开放渠道,读者可据此评估 3.5 Flash 在智能体与编码场景的实用性。
Sea Limited 的 CPO 阐述了公司为何在工程团队中部署 Codex,以加速亚洲 AI 原生软件开发。文章讨论了 Sea 对智能体软件开发未来的看法。
OpenAI 宣布 Codex 可在 ChatGPT 手机应用中使用,支持随时处理编码任务。用户可以在移动设备与远程环境中实时监控、调整和批准编码任务。
OpenAI 构建了一个安全沙箱,使 Codex 能够在 Windows 上运行,并通过受控的文件访问和网络限制来保障安全。
NVIDIA 的工程与研究团队使用 Codex(搭配 GPT-5.5)交付生产系统,并把研究想法转化为可运行的实验。
OpenAI 举办 Parameter Golf 活动,汇聚 1000+ 参与者和 2000+ 提交作品,探索 AI 辅助机器学习研究。活动在严格约束下覆盖 coding agents、量化和新型模型设计等方向。
德国汽车平台 AutoScout24 使用 OpenAI 的 Codex 与 ChatGPT 加速开发周期、提升代码质量,并扩大 AI 在工程团队中的应用。
OpenAI 介绍其如何在内部安全运行 Codex 编码智能体,做法包括沙箱隔离、审批机制、网络策略和面向 Agent 的遥测,以支持安全合规的编码智能体落地。
Simplex 采用 ChatGPT Enterprise 和 Codex 提升软件开发效率,缩短了设计、构建和测试所需的时间,并扩展了 AI 驱动的工作流。
Google DeepMind 汇总 Gemini 驱动的编码智能体 AlphaEvolve 一年来的应用成果,并通过 Google Cloud 将其带给商业客户。
推荐理由:官方汇总了 AlphaEvolve 在医疗、电网、数学和商业客户中的具体成果数字,读者可以据此评估这类算法进化智能体的实际落地范围。
Singular Bank 基于 ChatGPT 和 Codex 构建了内部助手 Singularity,帮助银行家在会议准备、投资组合分析和后续跟进等工作中每天节省 60–90 分钟。
OpenAI 的 B2B Signals 研究显示,前沿企业正在深化 AI 采用、扩展基于 Codex 的智能体工作流,并由此构建可持续的竞争优势。
OpenAI 推出 Symphony,一个面向 Codex 编排的开源规范,可将 issue 跟踪器转化为始终运行的智能体系统。该规范旨在提升工程产出并减少上下文切换。
OpenAI 发布 GPT-5.5,面向编程、研究和数据分析等复杂任务,支持跨工具使用。
OpenAI 推出 Codex Labs,并与 Accenture、PwC、Infosys 等伙伴合作,帮助企业在软件开发全生命周期中部署和扩展 Codex。同时 Codex 周活跃用户达到 4M。
Hyatt 在全球员工范围内部署 ChatGPT Enterprise,使用 GPT-5.4 和 Codex 提升生产力、运营和宾客体验。
OpenAI 更新 macOS 和 Windows 版 Codex 应用,新增 computer use、应用内浏览、图像生成、记忆和插件功能,用于加速开发者工作流。
推荐理由:原文点出 Codex 桌面端新增的多项能力,开发者可据此评估是否将其纳入日常工作流。
Hugging Face 发布一个 Skill 和独立测试套件,帮助贡献者把 transformers 模型移植到 mlx-lm,模型进入 transformers 后可更快在 MLX 上可用。
推荐理由:原文给出一个可复用的 Skill 加非智能体测试套件,并总结了让智能体 PR 符合开源惯例的具体规则,可迁移到其他项目。
OpenAI 介绍了旗下产品如何将 AI 应用于真实场景,涵盖工作、开发和日常任务。文中涉及 ChatGPT、Codex 和 API 等产品的实际用途。
CyberAgent 在广告、媒体和游戏业务中使用 ChatGPT Enterprise 和 Codex,安全地扩大 AI 应用规模。此举帮助公司提升质量并加快决策速度。
OpenAI 阐述企业 AI 的下一个阶段,称各行业的企业级 AI 采用正在加速。该阶段的核心包括 Frontier、ChatGPT Enterprise、Codex 以及覆盖全公司的 AI 智能体。
OpenAI 的 Codex 为 ChatGPT Business 和 Enterprise 用户新增按量付费定价,为团队提供更灵活的采用与扩展方式。此前团队用户只能按固定套餐使用,新模式可帮助团队从少量使用起步并随需求增长扩大规模。
Mistral AI 发布面向人类开发者和 Agent 的 Spaces CLI,三条命令即可从零搭建带热重载、数据库和生成 Dockerfile 的多服务项目并部署。
推荐理由:Mistral 以自家 CLI 为例,总结了一套让同一工具同时服务人类与 Agent 的可复用设计原则,细节具体。
Google 宣布 Vibe Coding XR,将 Gemini 与基于 WebXR、three.js 和 LiteRT.js 的开源 XR Blocks 框架结合,把自然语言直接转为可运行的物理感知 Android XR 应用,官方称可在 60 秒内完成。
OpenAI 使用链式思维(chain-of-thought)监控方法,研究内部编码智能体的对齐偏差问题。该方法通过分析真实部署中的智能体行为来检测潜在风险,并据此强化 AI 安全保障措施。
OpenAI 官方宣布将收购 Astral,称此举旨在加速 Codex 增长,为下一代 Python 开发者工具提供支撑。
OpenAI 推出 GPT-5.4 mini 和 nano,是 GPT-5.4 更小、更快的版本。两款模型针对编程、工具调用、多模态推理进行了优化,适用于高并发的 API 与子智能体工作负载。
Mistral 发布 Mistral Small 4,首次将 Magistral 的推理、Pixtral 的多模态和 Devstral 的编码能力统一到单一模型,采用 Apache 2.0 许可开源。
推荐理由:官方宣布 Small 家系统一推理、多模态与编码能力,并给出架构参数和推理效率对比,便于评估开源部署性价比。
Mistral 发布 Leanstral,称其为首个面向 Lean 4 的开源代码智能体,权重采用 Apache 2.0 许可证,提供 120B-A6B 稀疏架构(6B 激活参数),并集成于 Mistral Vibe 及免费 API 端点 labs-leanstral-2603。
OpenAI 的 Codex Security 不依赖传统 SAST 报告,而是通过 AI 驱动的约束推理和验证来发现真实漏洞,从而减少误报。
Mistral 在开源编码助手 Vibe 之上构建了一个自主 Agent,可读取 Rails 源码并生成或改进 RSpec 测试,在 CI/CD 中无人干预运行。
推荐理由:原文给出可直接复用的 AGENTS.md、skills 与自定义工具做法,以及质量分数变化,方法可迁移到其他代码测试场景。
OpenAI 推出 AI 应用安全智能体 Codex Security,目前处于研究预览阶段。该智能体通过分析项目上下文来检测、验证并修复复杂漏洞,从而提供更高的置信度和更少的噪音。
OpenAI 发布 GPT-5.4,称其为面向专业工作最强、最高效的前沿模型。新模型在编码、计算机使用和工具搜索上达到 SOTA,并提供 1M-token 上下文窗口。
推荐理由:OpenAI 官方给出 GPT-5.4 的能力定位与 1M-token 上下文,可据此判断其在专业工作场景中的可用性。
OpenAI 与 Figma 推出新的 Codex 集成,打通代码与设计。该集成让团队可以在代码实现与 Figma 画布之间直接切换,从而更快地迭代和交付产品。
OpenAI 宣布不再使用 SWE-bench Verified 评测前沿编程能力,分析显示该基准存在测试缺陷与训练数据泄漏,污染日益严重,无法准确衡量前沿编程进展。OpenAI 推荐改用 SWE-bench Pro。
Hugging Face 发布教程,讲解如何用编码智能体(Claude Code、Codex、Open Code)配合 Unsloth 在 HF Jobs 上微调 LiquidAI/LFM2.5-1.2B-Instruct。
推荐理由:官方教程给出用编码智能体加 Unsloth 在 HF Jobs 上微调小模型的完整流程,含脚本、命令和各尺寸 GPU 的每小时成本参考。
Hugging Face 官方博客介绍 Gradio 6 中 gr.HTML 支持自定义模板、scoped CSS 和 JavaScript 交互,可让 LLM 一次性生成前端、后端和状态管理都在单个 Python 文件里的应用。
推荐理由:原文由官方讲解 gr.HTML 的模板机制和 API,并结合多类应用示例说明如何用单个 Python 文件构建交互式组件。
OpenAI 与 Paradigm 联合推出 EVMbench,一个评估 AI 智能体能否检测、修补和利用高危智能合约漏洞的评测基准。该基准聚焦智能体在智能合约安全场景下的实际能力。
OpenAI 介绍其构建的实时访问系统,结合速率限制、用量追踪和 credits,为 Sora 和 Codex 提供持续访问能力。材料仅提供摘要,未包含更多细节。
Hugging Face 发布一个随 kernels 库分发的智能体技能,教编码智能体编写可集成进 transformers 和 diffusers 的生产级 CUDA 内核。
推荐理由:原文给出技能安装方法、覆盖内容和 H100 实测数据,读者可以照此让编码智能体生成并发布 CUDA 内核。