如何用 LeRobot SO-101 机械臂对 Isaac GR00T N1.5 进行后训练
NVIDIA 发布 Isaac GR00T N1.5——首个开源通用人形机器人基础模型 GR00T N1 的首次重大更新,并提供用 LeRobot SO-101 机械臂遥操作数据进行微调的完整教程。
NVIDIA 发布 Isaac GR00T N1.5——首个开源通用人形机器人基础模型 GR00T N1 的首次重大更新,并提供用 LeRobot SO-101 机械臂遥操作数据进行微调的完整教程。
Mistral AI 发布 Mistral Compute,向客户提供私有集成 AI 基础设施,涵盖 GPU、编排、API、产品和服务,形态从裸金属服务器到全托管 PaaS。作为 NVIDIA 合作伙伴,初期提供数万块 GPU 并计划快速扩张,面向欧洲、中东、亚洲及南半球的主权、企业和研究机构,强调数据主权、欧洲合规与脱碳能源,已有 Orange、BNP Paribas、Thales 等启动伙伴。
Hugging Face 与 NVIDIA 在 GTC Paris 上宣布推出 Training Cluster as a Service,让全球研究机构可按需申请 GPU 集群并只为训练运行时长付费。
Mistral AI 发布首个推理模型 Magistral,含 24B 开源的 Magistral Small(Apache 2.0)和企业版 Magistral Medium。
推荐理由:原文给出两版本的具体评测分数、开源许可和部署渠道,读者可据此评估其在推理模型中的定位与可用性。
OpenAI 推出 Outbound Coordinated Disclosure Policy,指导如何负责任地向第三方软件报告漏洞。该政策强调诚信、协作与主动式安全,旨在规模化提升安全防护。
Hugging Face 发布 ScreenSuite,一套覆盖感知、定位、单步操作和多步智能体四类能力的 GUI Agent 评测套件,整合 13 个基准,如 ScreenQA-Short、ScreenSpot-Pro、AndroidWorld 和 OSWorld。
OpenAI 表示正在对抗一项应纽约时报及原告要求发出的法院命令,该命令要求无限期保留消费级 ChatGPT 和 API 用户数据。OpenAI 称将努力维护用户隐私、满足法律要求并遵守其数据保护承诺。
推荐理由:原文说明 OpenAI 为何抵制纽约时报提出的数据保留要求,读者可以了解这一法院命令对用户隐私的影响。
OpenAI 发布最新报告,通过案例说明其如何检测和防范 AI 的恶意使用。该报告为 2025 年 6 月期,展示了 OpenAI 在拦截滥用行为方面的实际做法。
Mistral 发布 Mistral Code,一款面向企业开发团队的 AI 编程助手,基于开源项目 Continue 打造,今日面向 JetBrains IDE 和 VSCode 开放 private beta,GA 即将推出。
Hugging Face 在 nanoVLM 仓库中从零实现 KV Caching,生成速度提升 38%。文章讲解自回归生成中重复计算 K/V 的冗余来源,展示通过逐层缓存字典、start_pos 位置对齐以及将 generate 循环拆分为 prefill 和 decode 两阶段来消除冗余计算,并指出这是速度与显存之间的权衡。
Arm 生态负责人 Michael Gamble 构建了一个在 Arm CPU 上本地运行的音频生成应用,无需 GPU 或云端推理。该应用基于 Stability AI 的 Stable Audio Open 模型(经 Hugging Face 获取),用 PyTorch 和 TorchAudio 执行推理,通过减少扩散步数(steps=7)和全线程利用实现数秒内生成。
H Company 发布开源 Action VLM 系列 Holo1(含 Holo1-3B 与 Holo1-7B),并同步开源含 1,639 项 UI 任务的 WebClick 多模态定位基准。
推荐理由:官方给出模型规格、定位准确率和每任务成本数字,读者可据此评估这套开源 GUI 自动化方案的实际性价比。
Hugging Face 在 TRL v0.18.0 通过 PR #3394 引入 vllm_mode="colocate",让 vLLM 不再以独立 HTTP 服务器运行,而是嵌入同一分布式进程组,与 GRPO 训练共享同一批 GPU,消除训练与生成之间的互相等待。
Hugging Face 发布 450M 参数的开源视觉-语言-动作模型 SmolVLA,基于 lerobot 标签下的社区共享数据集预训练,可在消费级硬件(甚至 CPU 或 MacBook)上运行和训练。
OpenAI 封禁了一批使用 AI 生成帖子的账号,这些帖子用于抨击一位台湾社交媒体网红并涉及相关美国议题,OpenAI 将该行动命名为 Operation Sneer Review,判断其为中国起源的影响力活动。
OpenAI 封禁了一批利用 AI 在多个社交平台上生成有关菲律宾政治和公职人员评论的账号。此次行动被 OpenAI 称为"Operation High Five"。
OpenAI 停用一批中国来源账号,这些账号利用 AI 生成美国政治内容,并调查美国人物、运动和在线社区,属于美国政治极化影响力活动。
OpenAI 封禁了疑似来自俄罗斯、利用 AI 生成涉及乌克兰、北约和德国内政的德语政治内容的账号。
OpenAI 封禁了与涉嫌欺骗性就业活动相关的账号。这些活动利用 AI 制作材料,用于可能存在欺诈行为的远程职位申请。
OpenAI 封禁了使用 AI 构建恶意软件、完善 loader 并调试网络攻击工具的俄语账号,该行动代号 Operation ScopeCreep。
OpenAI 封禁了被公开归属于中国的威胁行为体 Vixen 和 Keyhole Panda 关联的账号。这些行为体利用 AI 辅助漏洞研究、脚本编写、翻译和运维故障排查。
OpenAI 封禁了疑似源自柬埔寨、利用 AI 支持诈骗工作流的账号,这些诈骗以英国民众为目标,通过伪装成“拨错号码”开启任务型骗局。
OpenAI 封禁了疑似与伊朗关联的 STORM-2035 影响力操作相关的账号,该操作利用 AI 生成涉及美国、英国、爱尔兰和委内瑞拉政治的影响力内容。
OpenAI 封禁了利用 AI 进行社会工程的账号。相关活动还包括以监控为主题的研究,以及针对批评者的影响力行动。
Wix 的 AI Website Builder 由 OpenAI 提供支持,用户只需在对话中描述自己的想法,即可在几分钟内创建完整网站。该工具降低了建站门槛,普通用户无需手动设计也能快速上线。
Mistral 发布首款代码专用嵌入模型 Codestral Embed,性能超越 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
Hugging Face 发布研究,让 CodeAgent 以强制 JSON 结构同时生成 thoughts 和 code,在 GAIA、MATH、SimpleQA、Frames 等基准上比常规 CodeAgent 平均高出 2-7 个百分点。
推荐理由:原文给出结构化输出结合 CodeAgent 的实测数据与适用边界,读者可据此判断自己的模型规模是否适合启用该方案。
Mistral 发布新的 Agents API,将语言模型与代码执行、网页搜索、图像生成、文档库和 MCP 工具等内置连接器结合,用于构建企业级智能体应用。
推荐理由:官方完整说明新 API 的内置连接器、有状态对话与多智能体编排,附 SimpleQA 对比数字和多个 cookbook,可直接评估落地方式。
TRL 的 GRPOTrainer 通过 compute_liger_loss 接入 liger_kernel 的 GRPO loss。
Hugging Face 发布 Python 版 Tiny Agents,将 huggingface_hub SDK 扩展为 MCP Client,用约 70 行代码即可构建可调用 MCP 工具的 Agent。
推荐理由:官方博客展示了 MCP Client 如何让约 70 行 Python 代码搭起可调用工具的 Agent,核心思路可迁移到自己的项目。
Hugging Face 与 Dell 在 Dell Tech World 上发布新版 Dell Enterprise Hub,提供模型与应用套件,可在 Dell AI 服务器和 AI PC 上本地部署 AI。
OpenAI 发布系统卡附录,宣布将 Operator 原本基于 GPT-4o 的模型替换为基于 OpenAI o3 的版本。API 版本仍保持基于 4o 不变。
CodeRabbit 使用 OpenAI 的 o3、o4-mini 和 GPT-4.1 模型改进代码审查,提升审查准确性并加快 PR 合并速度,帮助开发者以更少的 bug 更快交付代码,获得更高回报。
OpenAI 推出 Stargate UAE,这是其 AI 基础设施平台 Stargate 的首次国际部署。
推荐理由:官方宣布 Stargate 首次落地海外,读者可从中了解 OpenAI 基础设施出海的动向。
Mistral AI 与 All Hands AI 联合发布面向软件工程任务的智能体模型 Devstral,以 Apache 2.0 许可开源,在 SWE-Bench Verified 上取得 46.8%,超过此前开源 SoTA 6 个百分点以上,并超越 GPT-4.1-mini 超过 20%。
推荐理由:原文给出 SWE-Bench Verified 具体分数和部署门槛,可判断这款开源编码模型在本地与隐私场景的可行性。
TII 发布 Falcon-H1 系列开源模型,包含 0.5B、1.5B、1.5B-Deep、3B、7B、34B 六种规模及对应 instruct 版本,采用注意力与 Mamba-2 并行的混合架构,基于 Apache 2.0 类宽松许可。
Hugging Face 联合 TII 推出 Falcon-Arabic,一个基于 Falcon 3 架构的 7B 参数多语言大模型,支持阿拉伯语和英语。模型通过扩展 32,000 个阿拉伯语 token 进行持续预训练,上下文长度为 32,000 tokens。
Hugging Face 发布 nanoVLM,一个纯 PyTorch 的轻量工具包,可在免费 Colab 上启动视觉语言模型训练,灵感来自 Andrej Karpathy 的 nanoGPT。
推荐理由:原文拆解了 nanoVLM 的架构、训练与推理全流程,代码轻量可读,适合想从头理解 VLM 训练机制的读者上手实践。
Hugging Face 发布 Diffusers 量化后端解读文章,以 black-forest-labs/FLUX.1-dev 为例实测 bitsandbytes、torchao、Quanto、GGUF 和 FP8 Layerwise Casting 五种方案。
推荐理由:文章系统对比了 Diffusers 各量化后端在 Flux-dev 上的内存、速度与画质差异,并给出选型建议和可复现代码。
Microsoft 与 Hugging Face 在 Microsoft Build 上宣布扩大合作,Azure AI Foundry 现提供 10,000+ Hugging Face 开放模型,可数次点击部署以支持文本、音频和图像 AI 应用。