Scout24 如何用 GPT-5 打造下一代房产搜索
Scout24 基于 GPT-5 打造了一个对话式房产搜索助手。该助手通过引导性的澄清提问、内容总结和个性化房源推荐,帮助用户完成房产搜索体验。
Scout24 基于 GPT-5 打造了一个对话式房产搜索助手。该助手通过引导性的澄清提问、内容总结和个性化房源推荐,帮助用户完成房产搜索体验。
Mistral AI 发布开源编码模型 Devstral 2(123B)和 Devstral Small 2(24B),SWE-bench Verified 分别取得 72.2% 和 68.0%,并推出开源终端编码智能体 Mistral Vibe CLI。
推荐理由:官方公布两个尺寸开源编码模型的基准成绩、许可与部署门槛,并同步开放终端 CLI,读者可评估其替代现有方案的成本。
OpenAI 宣布联合发起 Linux Foundation 旗下的 Agentic AI Foundation,并捐赠 AGENTS.md,以支持面向安全智能体 AI 的开放、可互操作标准。
推荐理由:OpenAI 官方宣布捐出 AGENTS.md 并参与设立开放标准基金会,读者可以据此跟踪智能体互操作标准的走向。
Intel AI 软件团队推出 DeepMath,一个基于 Qwen3-4B Thinking、用 GRPO 微调并通过 smolagents 实现的数学推理智能体。模型用简短 Python 代码片段替代冗长文本推理,在沙箱中执行后回填推理上下文,输出长度最多减少 66%,同时常提升准确率。在 MATH500、AIME、HMMT、HLE 四个数据集上,GRPO 训练与智能体推理结合取得最高准确率。
Hugging Face 推出 hf-llm-trainer 技能,让 Claude Code、Codex、Gemini CLI 等编码智能体可自动选择 GPU、生成脚本、向 Hugging Face Jobs 提交微调任务并用 Trackio 监控进度,完成后模型自动推送到 Hub。
推荐理由:官方发布了让 Claude Code 等编码智能体端到端微调开源模型的 hf-llm-trainer 技能,覆盖 GPU 选择、任务提交到监控的完整流程。
Mirakl 正借助 AI 智能体和 ChatGPT Enterprise 重塑商务流程,实现更快的文档处理和更智能的客户支持。公司同时依托 Mirakl Nexus 构建面向智能体的原生商务体系。
Accenture 与 OpenAI 达成合作,帮助企业将智能体(agentic)AI 能力融入业务核心,释放新的增长空间。
Tavily 分享其打造达到 SOTA 水平的 deep research 智能体的经验:七个月前他们放弃了第一版复杂架构并从零重建,因为其中的假设在下一代模型到来时成为瓶颈。
Google DeepMind 宣布支持白宫 Genesis Mission,与 DOE 合作加速美国科学研究。
OpenAI 与 Target 合作,在 ChatGPT 中推出新的 Target 应用,提供个性化购物和更快的结账体验。Target 还将扩大 ChatGPT Enterprise 的使用范围,以提升员工生产力和顾客体验。
OpenAI 推出面向 Codex 的 GPT-5.1-Codex-Max,定位为更快速、更智能的智能体编码模型。该模型面向长时间运行的项目级工作,具备增强的推理能力和更高的 token 效率。
推荐理由:官方说明了该模型面向长时间项目级任务定位,并强调推理与 token 效率改进,可作为选用参考。
OpenAI 发布 GPT-5.1-CodexMax 系统卡,介绍其配套安全措施。模型层面包括针对有害任务和提示词注入的专项安全训练;产品层面包括 agent 沙箱和可配置的网络访问权限。
Google DeepMind 发布 Gemini 3,称 Gemini 3 Pro 为其最智能模型,在各大基准上超越此前的 2.5 Pro。
推荐理由:官方发布给出了 Gemini 3 Pro 的基准成绩、API 定价和新工具入口,开发者可以直接评估是否迁移到现有编码与智能体工作流。
Google DeepMind 发布 Gemini 3,先以 Gemini 3 Pro 预览版形式推出,并预告增强推理模式 Gemini 3 Deep Think。
推荐理由:官方发布给出完整基准成绩和覆盖入口,读者可据此判断 Gemini 3 Pro 的推理与编码能力以及它如何嵌入现有工具链。
Google DeepMind 推出智能体开发平台 Google Antigravity,包含 AI IDE 式 Editor 界面和面向异步协作的 Manager 界面,支持智能体自主规划并执行端到端软件任务。
推荐理由:官方宣布了 Antigravity 的产品形态、免费预览和可用模型,读者可据此评估它对现有开发流程的影响。
Google 发布生成式 UI 实现,可按提示词动态生成网页、游戏、工具等定制交互界面,相关论文为 Generative UI: LLMs are Effective UI Generators。
推荐理由:原文介绍了生成式 UI 的实现原理、产品入口和人评结果,读者可以了解这一交互范式如何落地到现有产品。
Google DeepMind 发布 SIMA 2,将 Gemini 模型嵌入智能体核心,使其从跟随指令进化为能思考目标、与用户对话并自我改进的通用游戏智能体。
推荐理由:官方介绍 SIMA 2 如何借 Gemini 从执行指令走向推理与自改进,读者可了解具身智能体训练路径。
提示词注入是 AI 系统面临的前沿安全挑战。OpenAI 介绍了这类攻击的运作方式,并说明其如何通过推进相关研究、训练模型和构建安全防护来保护用户。
Google Research 推出 DS-STAR 数据科学智能体,通过数据文件分析模块、LLM 判官验证和顺序规划迭代三项创新,支持 JSON、非结构化文本等异构数据格式。
OpenAI 推出 Aardvark,一个能自主发现、验证并协助修复软件漏洞的 AI 安全研究员。该系统目前处于 private beta 阶段,用户可报名参加早期测试。
MiniMax 团队成员分享 MiniMax M2 后训练中智能体对齐的关键经验。结论包括:智能体需要 Interleaved Thinking,思考可在任务任意阶段发生以应对工具输出等外部扰动。
OpenAI 深入解析了为 ChatGPT Atlas 浏览器打造的新架构 OWL。OWL 将 Chromium 解耦,实现快速启动和丰富 UI,并支持与 ChatGPT 结合的 agentic 浏览体验。
安全公司 Doppel 使用 GPT-5 和强化微调来阻止 deepfake 与身份冒充攻击,在攻击扩散前完成拦截。该系统将分析师工作量减少 80%,并把响应时间从数小时缩短到数分钟。
Hugging Face 发布 huggingface_hub v1.0,该库现支持 20 万依赖库,并提供超过 200 万公开模型、50 万公开数据集和 100 万公开 Spaces 的访问。
推荐理由:官方完整梳理了 huggingface_hub 五年演进与 v1.0 的破坏性变更,含兼容性影响和迁移指引,对依赖该库的开发者有直接参考价值。
Mistral 发布 Mistral AI Studio,将支撑其自身大规模系统的基础设施打包给企业团队,用于在生产环境构建、评估和运行 AI。平台由三大支柱组成:Observability、基于 Temporal 的 Agent Runtime 和 AI Registry,提供评估、可追溯反馈回路、版本管理与治理能力,并支持混合、专用和自托管部署。
Consensus 基于 GPT-5 和 OpenAI Responses API 构建多智能体研究助手,可在几分钟内读取、分析并综合文献证据。该平台已帮助超过 800 万研究人员加速科学发现。
Meta-PyTorch 与 Hugging Face 联合推出 OpenEnv Hub,一个共享开放的智能体环境社区平台,同时发布 OpenEnv 0.1 规范(RFC)征集社区反馈。
人力资源平台 HiBob 通过 ChatGPT Enterprise 和自建 custom GPT 规模化推行 AI,已打造 2,500 个 GPT,用于提升营收、精简 HR 工作流,并在 Bob 平台中推出 AI 驱动的功能。
BigCode 发布 BigCodeArena,一个通过真实执行来评判代码生成模型的人类投票平台,支持 10 种语言和 8 种执行环境,开放无需注册。上线 5 个月收集 14K 对话、4700+ 偏好投票,Elo 排名中 o3-mini 和 o1-mini 居首。
推荐理由:基于5个月社区执行评估数据发布代码生成评测平台,给出分语言和执行环境的模型表现差异与两个新基准。
OpenAI 发布 AgentKit、扩展 Evals 能力,并为智能体推出强化微调(RFT),帮助开发者更快地从原型走向生产。
推荐理由:官方宣布面向开发者的智能体工具套件,可帮助关注 Agent 开发的读者了解从原型到生产的最新官方工具链。
OpenAI 构建了一套合同数据提取系统,可快速提取合同信息,缩短处理周转时间,让各团队更便捷地获取所需合同细节。
作者发布 VibeGame,一个建立在 three.js、rapier 和 bitecs 之上、面向 AI 辅助游戏开发的高层声明式游戏引擎。
推荐理由:作者先实测 Roblox、Unity 和 web 三条 vibe coding 游戏路线,再据此设计出兼顾抽象与开放性的引擎,方法可迁移。
Hugging Face 与 Intel 基于 OpenVINO 在 Intel Core Ultra 集成 GPU 上加速 Qwen3-8B:用 Qwen3-0.6B 作草稿模型的投机解码带来约 1.3× 提速,再从草稿模型 28 层中剪掉 6 层并用 Qwen3-8B 生成的 500k 提示词数据微调后,提速提升至约 1.4×。
OpenAI 宣布在 ChatGPT 中迈出 agentic commerce 的第一步,推出 Instant Checkout 和 Agentic Commerce Protocol,为用户、AI 智能体和商家提供共同购物的新方式。
推荐理由:OpenAI 官方宣布 ChatGPT 引入购物结算与开放协议,读者可据此了解 AI 智能体参与电商交易的早期方向。
OpenAI 发布 ChatGPT Pulse 预览版,面向移动端 Pro 用户。Pulse 是一种新体验,ChatGPT 会主动做研究,基于用户的聊天记录、反馈以及日历等连接应用生成个性化更新。
Hugging Face 发布 Smol2Operator 方案,将无 GUI 定位能力的 SmolVLM2-2.2B-Instruct 通过两阶段 SFT 训练为 GUI 智能体,在 ScreenSpot-v2 上从基线 0 提升到 61.71%。
Meta 的 Hugging Face 团队发布 GAIA 后续基准 Gaia2 和配套开源框架 Meta Agents Research Environments(ARE),Gaia2 数据集采用 CC BY 4.0 许可,ARE 采用 MIT 许可。
推荐理由:官方发布新基准 Gaia2 和开源评估框架 ARE,含七类任务和主流模型结果,便于开发者调试和评估自己的 Agent。
OpenAI 在 GPT-5 系统卡附录中发布新模型 GPT-5-Codex,是针对 Codex 中智能体编码进一步优化的 GPT-5 版本。该模型会根据任务复杂度更动态地调整思考力度,简单对话或小任务快速响应,复杂任务则可独立长时间工作。
推荐理由:原文说明新模型在思考力度上按任务复杂度动态调整,读者可了解其与 GPT-5 在编码场景下的差异。
Hugging Face 发布 Jupyter Agent 项目,用约 2TB Kaggle 笔记本构建 51k 条合成轨迹、近 0.2B tokens 的数据集,微调 Qwen3-4B-Instruct-2507 与 Qwen3-4B-Thinking-2507。
推荐理由:原文完整给出从数据清洗到微调的管线与消融数字,读者可复用其中提升小模型数据科学能力的做法。
Mistral 为 Le Chat 推出 Memories(beta)记忆功能,采用自动保存与智能、可见召回的混合方案。功能遵循透明、可控、主权三原则,用户可随时关闭记忆、开启隐身聊天、编辑或删除单条记忆,并支持导出导入;还提供 Memory Insights 轻量提示帮助探索记忆内容,移动端可在 App Store 或 Google Play 下载体验。