OpenAI 公布 AI 模型在 First Proof 数学挑战中的证明尝试
OpenAI 分享其 AI 模型对 First Proof 数学挑战的证明尝试,在专家级数学问题上测试研究级推理能力。相关证明过程已公开,用于检验模型在研究级难题上的推理表现。
OpenAI 分享其 AI 模型对 First Proof 数学挑战的证明尝试,在专家级数学问题上测试研究级推理能力。相关证明过程已公开,用于检验模型在研究级难题上的推理表现。
Hugging Face 发布教程,讲解如何用编码智能体(Claude Code、Codex、Open Code)配合 Unsloth 在 HF Jobs 上微调 LiquidAI/LFM2.5-1.2B-Instruct。
推荐理由:官方教程给出用编码智能体加 Unsloth 在 HF Jobs 上微调小模型的完整流程,含脚本、命令和各尺寸 GPU 的每小时成本参考。
GGML 及 Georgi Gerganov 团队宣布加入 Hugging Face,以保障本地 AI 的长期开源发展。团队将继续全职维护 llama.cpp,保持技术方向与社区自治,项目继续 100% 开源、社区驱动;双方计划让 transformers 中的模型定义能近乎一键地在 llama.cpp 中落地,并改进基于 ggml 的软件的打包与用户体验。
推荐理由:收购方官方说明团队加入后的自治安排与技术方向,读者可据此评估 llama.cpp 社区的连续性与本地推理生态走向。
Google DeepMind 发布 Gemini 3.1 Pro,在 ARC-AGI-2 上取得 77.1% 的 verified 成绩,推理表现是 3 Pro 的两倍以上。
推荐理由:官方公布 ARC-AGI-2 得分并覆盖消费端与开发者端入口,读者可以直接对照现有工作流评估升级。
OpenAI 向 The Alignment Project 承诺出资 750 万美元,用于资助独立的 AI 对齐研究。该举措旨在加强全球范围内应对 AGI 安全风险的努力。
OpenAI 推出 OpenAI for India 计划,在印度扩大 AI 覆盖范围。该计划包括建设本地基础设施、为印度企业提供 AI 支持以及提升劳动力 AI 技能。
IBM Research 与 UC Berkeley 将 MAST(多智能体系统失败分类法)应用于 ITBench,标注了 310 条由 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 产生的 SRE 执行轨迹,把成功率之外的黑盒失败转成结构化失败签名。
推荐理由:原文把基准的单一成功率拆解为结构化失败模式,并针对三类模型给出对应的工程修复方向。
Google DeepMind 在 Gemini 应用中以 beta 形式上线最新音乐生成模型 Lyria 3,用户输入文字或上传照片即可生成 30 秒带歌词曲目。
推荐理由:官方介绍了 Lyria 3 的三项能力改进和 SynthID 音频验证入口,读者可据此了解 Gemini 音乐生成与识别 AI 内容的新玩法。
Hugging Face 官方博客介绍 Gradio 6 中 gr.HTML 支持自定义模板、scoped CSS 和 JavaScript 交互,可让 LLM 一次性生成前端、后端和状态管理都在单个 Python 文件里的应用。
推荐理由:原文由官方讲解 gr.HTML 的模板机制和 API,并结合多类应用示例说明如何用单个 Python 文件构建交互式组件。
OpenAI 与 Paradigm 联合推出 EVMbench,一个评估 AI 智能体能否检测、修补和利用高危智能合约漏洞的评测基准。该基准聚焦智能体在智能合约安全场景下的实际能力。
Google Research 发布 MapTrace,这是面向多模态大语言模型(MLLM)地图路径追踪任务的新任务、数据集与合成数据生成管线。
Google DeepMind 与印度政府机构和本地机构建立新的 National Partnerships for AI 合作,向印度研究人员开放 AlphaGenome、AI Co-scientist、Earth AI 等前沿 AI for Science 模型。
OpenAI 发布预印本,显示 GPT-5.2 提出了一个新的 gluon amplitude(胶子振幅)公式,该公式随后由 OpenAI 与学术合作者正式证明和验证。
推荐理由:模型提出的新物理公式经学术合作者证明与验证,可作为前沿模型科研能力的具体例证。
OpenAI 在 ChatGPT 中推出 Lockdown Mode 和 Elevated Risk 风险标签,帮助组织防御提示词注入和 AI 驱动的数据外泄。
OpenAI 推出开源工具包 GABRIEL,利用 GPT 将定性文本和图像转化为定量数据,帮助社会科学家大规模分析研究数据。该工具包面向社会科学研究领域,已开源可用。
OpenAI 介绍其构建的实时访问系统,结合速率限制、用量追踪和 credits,为 Sora 和 Codex 提供持续访问能力。材料仅提供摘要,未包含更多细节。
Hugging Face 发布一个随 kernels 库分发的智能体技能,教编码智能体编写可集成进 transformers 和 diffusers 的生产级 CUDA 内核。
推荐理由:原文给出技能安装方法、覆盖内容和 H100 实测数据,读者可以照此让编码智能体生成并发布 CUDA 内核。
Google DeepMind 发布 Gemini 3 Deep Think 重大升级,面向科学、研究和工程挑战的专用推理模式。
推荐理由:原文给出 Deep Think 多项基准成绩和 API 开放入口,读者可以据此评估它在科研与工程场景的可用性。
OpenAI 发布首个实时编码模型 GPT-5.3-Codex-Spark,生成速度提升 15x,支持 128k 上下文。模型以研究预览形式向 ChatGPT Pro 用户开放。
推荐理由:OpenAI 官方公布实时编码模型的速度与上下文规格及试用范围,正在用该模型的用户可据此评估是否切换。
Turing 在 Meta 与 Hugging Face 的开源框架 OpenEnv 上构建了生产级日历管理环境 Calendar Gym,用于在访问控制、时间推理和多智能体协调等真实约束下评估工具调用智能体。
OpenAI 技术成员 Ryan Lopopolo 撰文介绍如何在智能体优先的开发模式中利用 Codex,阐述 harness 工程的实践方法。文章来自 OpenAI News,面向希望将 Codex 融入智能体化工作流的工程团队。 (注:正文仅提供了作者署名,摘要主要基于原始标题与来源信息,未添加原文未提及的细节。)
Google Research 在 ACM UIST 2025 上推出开源原型框架 DialogLab,用于编写、模拟和测试动态的人-AI 群组对话。框架通过“author-test-verify”三阶段工作流,将社交设置与对话时间推进解耦,提供拖放画布、human control 模式和可视化验证仪表盘。
Google Research 与 Google DeepMind 在 NeurIPS 2025 工作坊论文中展示,以鸟类等陆生动物声音训练的生物声学基础模型 Perch 2.0,虽未使用水下音频,仍能通过嵌入向量迁移学习对鲸类发声进行分类。
Google DeepMind 发布两篇论文,介绍 Gemini Deep Think 在专家指导下解决数学、物理和计算机科学的专业研究问题。其数学研究智能体 Aletheia 配备自然语言验证器并可承认失败,在 IMO-ProofBench Advanced 上最高得分 90%,并自主解决 Bloom's Erdős 猜想数据库中的四个开放问题,包括 Erdős-1051。
推荐理由:原文给出两篇论文的具体成果和方法细节,读者可以了解 AI 辅助科研的实际边界与协作模式。
OpenAI for Government 宣布在 GenAI.mil 上部署定制版 ChatGPT,为美国国防团队提供安全、注重安全性的 AI 能力。
Hugging Face 发布 Transformers.js v4,已可在 NPM 安装,核心变化是采用 C++ 重写的 WebGPU Runtime,同一套代码可运行于浏览器、Node、Bun 和 Deno。
推荐理由:官方发布说明完整列出 WebGPU 运行时重写、新架构支持和构建性能数据,读者可评估在浏览器或服务端本地跑模型的可行性。
OpenAI 介绍了其 AI 本地化方法,说明全球共享的前沿模型如何在不牺牲安全性的前提下适配当地语言、法律和文化。
SyGra 2.0.0 引入交互式环境 Studio,让用户在画布上可视化编排合成数据生成流程,替代 YAML 文件和终端操作。
OpenAI 的 GPT-5 与 Ginkgo Bioworks 的云自动化平台结合,组成自主实验室,通过闭环实验将无细胞蛋白质合成成本降低了 40%。
OpenAI 推出 Trusted Access for Cyber,这是一个基于信任的框架,在扩展前沿网络安全能力访问的同时,强化防止滥用的安全防护措施。
Google 提出原生自适应界面(NAI)框架,用多模态 AI 让应用 UI 从静态导航转向智能体驱动的动态模块,服务全球 13 亿残障人士。
OpenAI 推出 OpenAI Frontier,一个面向企业的 AI 智能体平台,支持构建、部署和管理智能体。平台提供共享上下文、员工入驻、权限管理和治理功能。
OpenAI 推出 GPT-5.3-Codex,一个 Codex 原生智能体,将前沿编码能力与通用推理相结合,用于支持长周期、真实世界的技术工作。
OpenAI 发布 GPT-5.3-Codex,称其为迄今最强的智能体编码模型。它结合了 GPT-5.2-Codex 的前沿编码能力与 GPT-5.2 的推理和专业知识能力。
Mistral 发布 Voxtral Transcribe 2 系列,包含批处理转写模型 Voxtral Mini Transcribe V2 和实时模型 Voxtral Realtime。
推荐理由:官方发布了两个语音转写模型的具体性能、价格和开放权重信息,读者可以据此对比现有转写方案的成本与延迟。
Google Research 提出 Sequential Attention,一种用于特征选择等子集选择问题的贪心算法,利用注意力分数逐步选出最有价值的组件。它将选择过程集成到单次模型训练中,避免了传统贪心方法每步重新训练的高昂开销,以极小代价应用于大规模模型。该方法在多个神经网络基准上取得 SOTA 结果,并支持并行评估候选、提升可解释性。
OpenAI 介绍 Codex App Server,这是一个双向 JSON-RPC API,用于嵌入 Codex 智能体。该 API 支持流式进度、工具调用、审批和 diffs。
Hugging Face 在 Hub 上推出 Community Evals 功能,评测数据集(MMLU-Pro、GPQA、HLE 已上线)可托管排行榜,模型分数存于模型仓库的 .eval_results/*.yaml 并展示在 Model Card 上。
Google Research 宣布与 Included Health 合作,待 IRB 批准后启动一项全国范围、经参与者知情同意的随机对照研究,在真实虚拟诊疗流程中评估其对话式 AI。研究基于 AMIE 诊断推理、个人健康智能体(PHA)和信息导航等前期工作,此前与 Beth Israel Deaconess Medical Center 的单中心可行性研究已观察到安全性方面的积极迹象。
H 公司发布其最大的 UI 定位模型 Holo2-235B-A22B Preview,在 ScreenSpot-Pro 达到 78.5%、OSWorld G 达到 79.0%,创下 SOTA 纪录。该模型采用智能体定位方式迭代修正预测,带来 10-20% 相对提升,已作为研究版本在 Hugging Face 开放。训练使用 SkyPilot 统一管理跨云的 Kubernetes 集群任务。