NXP 如何把机器人 AI 带到嵌入式平台:数据集录制、VLA 微调与端侧优化
NXP 发布实践指南,讲解如何在嵌入式机器人平台上录制可靠数据集并微调 ACT 与 SmolVLA 等 VLA 策略,并展示 NXP i.MX 95 SoC 优化后的实时性能。
NXP 发布实践指南,讲解如何在嵌入式机器人平台上录制可靠数据集并微调 ACT 与 SmolVLA 等 VLA 策略,并展示 NXP i.MX 95 SoC 优化后的实时性能。
OpenAI 推出 CoT-Control,发现推理模型难以控制自己的思维链(CoT)。这一局限使思维链保持可被监控的状态,强化了可监控性作为 AI 安全保障手段的价值。
OpenAI 发布 GPT-5.4,称其为面向专业工作最强、最高效的前沿模型。新模型在编码、计算机使用和工具搜索上达到 SOTA,并提供 1M-token 上下文窗口。
推荐理由:OpenAI 官方给出 GPT-5.4 的能力定位与 1M-token 上下文,可据此判断其在专业工作场景中的可用性。
OpenAI 发布面向学校和教育机构的新工具、认证项目及评估资源,帮助缩小 AI 能力差距、扩大学习机会。该举措涵盖工具、认证与测量资源三类支持,旨在让教育中的 AI 应用更好地带来发展机遇。
Hugging Face 发布 Modular Diffusers,将扩散流水线拆成文本编码、去噪、解码等可独立运行、自由增删互换的可复用块,作为现有 DiffusionPipeline 的灵活补充。
推荐理由:原文展示了用可组合积木搭建扩散流水线的完整用法,包括自定义块、模块化仓库和 Mellon 可视化集成,方法可直接复用。
OpenAI 提出五大 AI 价值模型,展示企业领导者如何安排 AI 转型顺序,从员工 AI 素养培养逐步推进到流程重塑,以构建持久的业务优势。
德甲俱乐部沃尔夫斯堡(VfL Wolfsburg)以人为核心而非试点项目,将 ChatGPT 推广为覆盖全俱乐部的通用能力。此举旨在规模化提升效率、创造力和知识水平,同时不丢失俱乐部的足球本色。
OpenAI 推出 ChatGPT for Excel 和新的金融应用集成,由 GPT-5.4 驱动,用于加速受监管环境下的建模、研究和分析。
OpenAI 推出 Adoption news channel,用于分享将 AI 进展转化为业务优势的实用洞察和框架。该频道面向企业采纳场景,帮助组织把 AI 能力落地为商业价值。
Google Research 通过“Bayesian teaching”监督微调,让 LLM 模仿 Bayesian Assistant 的最优贝叶斯推理预测,弥补其默认简单启发式的不足。在简化航班推荐任务中,各系列 LLM 原本表现明显差于 Bayesian Assistant,且常在单轮交互后停滞;训练后不仅显著提升推荐任务表现,还能泛化到其他任务。
一篇新预印本论文将单负振幅扩展到引力子,借助 GPT-5.2 Pro 推导并验证了量子引力中非零的引力子树级振幅。该结果展示了 GPT-5.2 Pro 在理论物理推导与验证中的辅助作用。
Axios COO Allison Murphy 介绍了该公司如何利用 AI 支持本地记者、简化新闻编辑室工作流程,并大规模交付高影响力的本地新闻报道。
OpenAI 推出 Learning Outcomes Measurement Suite,用于评估 AI 对学生学习成效的影响。该工具套件面向多样化教育环境,可长期衡量 AI 在学习中的作用。
Photoroom 以约 $1500 算力预算(32 张 H200,$2/小时/GPU)在 24 小时内完成文生图扩散模型训练,并开源 PRX 训练代码与实验框架。
Google DeepMind 发布 Gemini 3.1 Flash-Lite,定位 Gemini 3 系列中最快、最具成本效益的模型,已在 Google AI Studio 和 Vertex AI 以 preview 形式推出。
推荐理由:官方公布定价与实测对比数据,开发者可据此评估高并发场景下换用该模型的速度与成本收益。
OpenAI 官方发布与美国战争部合同的说明,内容涵盖安全红线、法律保护,以及 AI 系统在涉密环境中的部署方式。
OpenAI 与 Amazon 宣布达成战略合作,将 OpenAI 的 Frontier 平台引入 AWS。合作覆盖扩展 AI 基础设施、定制模型以及企业级 AI 智能体。
推荐理由:官方宣布合作落地,OpenAI 的 Frontier 平台将通过 AWS 提供,关注企业 AI 基础设施的读者可据此评估可选项。
OpenAI 宣布 1100 亿美元($110B)新融资,投前估值为 7300 亿美元($730B pre money)。资金来源包括 SoftBank 300 亿美元、NVIDIA 300 亿美元和 Amazon 500 亿美元。
推荐理由:官方宣布融资规模与估值,金额和投资方均为一手信息,可用于了解 OpenAI 资本结构的变化。
Amazon Bedrock 推出 Stateful Runtime for Agents,为多步骤 AI 工作流提供持久编排、记忆和安全执行能力。该运行时由 OpenAI 模型驱动,可支持跨步骤保持状态的智能体应用。
OpenAI 与 Microsoft 联合发布声明,宣布双方将继续在研究、工程和产品开发领域紧密合作。声明强调双方多年深度协作与共同成功的合作基础。
OpenAI 公布心理健康安全工作的多项更新,包括家长控制、可信联系人功能以及改进的心理困扰检测能力。公司同时提及近期相关诉讼的进展情况。
Google DeepMind 发布 Nano Banana 2(Gemini 3.1 Flash Image),以 Flash 速度提供 Pro 级世界知识、精准文本渲染、最多 5 个角色的主体一致性和 512px 到 4K 的生产级规格。
推荐理由:官方公告列出了能力细节、订阅者保留路径和各产品开放范围,读者可据此判断是否切换工作流。
OpenAI 与太平洋西北国家实验室(PNNL)联合推出 DraftNEPABench 基准,评估 AI 编程智能体加急联邦审批的能力。该基准显示,AI 有望将 NEPA(国家环境政策法)文件起草时间缩短最多 15%,推动基础设施审查现代化。
OpenAI 与 Figma 推出新的 Codex 集成,打通代码与设计。该集成让团队可以在代码实现与 Figma 画布之间直接切换,从而更快地迭代和交付产品。
Hugging Face 博客介绍 transformers 库如何让 MoE 稀疏架构成为一等公民,涵盖权重加载重构、Expert Backend、专家并行和 MoE 训练支持。
OpenAI 发布最新威胁报告,分析恶意行为者如何将 AI 模型与网站和社交平台结合实施攻击。报告还探讨了这对检测与防御工作的影响。
OpenAI 任命 Arvind KC 为首席人事官(Chief People Officer)。他将帮助公司扩大规模、强化企业文化,并主导 AI 时代的工作方式演进。
OpenAI 宣布不再使用 SWE-bench Verified 评测前沿编程能力,分析显示该基准存在测试缺陷与训练数据泄漏,污染日益严重,无法准确衡量前沿编程进展。OpenAI 推荐改用 SWE-bench Pro。
OpenAI 宣布推出 Frontier Alliance Partners 计划,帮助企业将 AI 项目从试点阶段推进到生产环境,实现安全、可扩展的智能体部署。
OpenAI 分享其 AI 模型对 First Proof 数学挑战的证明尝试,在专家级数学问题上测试研究级推理能力。相关证明过程已公开,用于检验模型在研究级难题上的推理表现。
Hugging Face 发布教程,讲解如何用编码智能体(Claude Code、Codex、Open Code)配合 Unsloth 在 HF Jobs 上微调 LiquidAI/LFM2.5-1.2B-Instruct。
推荐理由:官方教程给出用编码智能体加 Unsloth 在 HF Jobs 上微调小模型的完整流程,含脚本、命令和各尺寸 GPU 的每小时成本参考。
GGML 及 Georgi Gerganov 团队宣布加入 Hugging Face,以保障本地 AI 的长期开源发展。团队将继续全职维护 llama.cpp,保持技术方向与社区自治,项目继续 100% 开源、社区驱动;双方计划让 transformers 中的模型定义能近乎一键地在 llama.cpp 中落地,并改进基于 ggml 的软件的打包与用户体验。
推荐理由:收购方官方说明团队加入后的自治安排与技术方向,读者可据此评估 llama.cpp 社区的连续性与本地推理生态走向。
Google DeepMind 发布 Gemini 3.1 Pro,在 ARC-AGI-2 上取得 77.1% 的 verified 成绩,推理表现是 3 Pro 的两倍以上。
推荐理由:官方公布 ARC-AGI-2 得分并覆盖消费端与开发者端入口,读者可以直接对照现有工作流评估升级。
OpenAI 向 The Alignment Project 承诺出资 750 万美元,用于资助独立的 AI 对齐研究。该举措旨在加强全球范围内应对 AGI 安全风险的努力。
OpenAI 推出 OpenAI for India 计划,在印度扩大 AI 覆盖范围。该计划包括建设本地基础设施、为印度企业提供 AI 支持以及提升劳动力 AI 技能。
IBM Research 与 UC Berkeley 将 MAST(多智能体系统失败分类法)应用于 ITBench,标注了 310 条由 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 产生的 SRE 执行轨迹,把成功率之外的黑盒失败转成结构化失败签名。
推荐理由:原文把基准的单一成功率拆解为结构化失败模式,并针对三类模型给出对应的工程修复方向。
Google DeepMind 在 Gemini 应用中以 beta 形式上线最新音乐生成模型 Lyria 3,用户输入文字或上传照片即可生成 30 秒带歌词曲目。
推荐理由:官方介绍了 Lyria 3 的三项能力改进和 SynthID 音频验证入口,读者可据此了解 Gemini 音乐生成与识别 AI 内容的新玩法。
Hugging Face 官方博客介绍 Gradio 6 中 gr.HTML 支持自定义模板、scoped CSS 和 JavaScript 交互,可让 LLM 一次性生成前端、后端和状态管理都在单个 Python 文件里的应用。
推荐理由:原文由官方讲解 gr.HTML 的模板机制和 API,并结合多类应用示例说明如何用单个 Python 文件构建交互式组件。
OpenAI 与 Paradigm 联合推出 EVMbench,一个评估 AI 智能体能否检测、修补和利用高危智能合约漏洞的评测基准。该基准聚焦智能体在智能合约安全场景下的实际能力。
Google Research 发布 MapTrace,这是面向多模态大语言模型(MLLM)地图路径追踪任务的新任务、数据集与合成数据生成管线。