特朗普政府公布 AI 安全自我监管协议《前沿责任联合承诺》全文
特朗普政府公布 AI 安全自我监管协议《前沿责任联合承诺》(Joint Commitment on Frontier Responsibilities),由 David Sacks 公开。
特朗普政府公布 AI 安全自我监管协议《前沿责任联合承诺》(Joint Commitment on Frontier Responsibilities),由 David Sacks 公开。
Instagram 宣布在独立 Edits 应用中推出 AI“创意助手”,基于用户账号数据为创作者提供发帖建议。该助手可调用点赞、观看量、视频留存率和分享等指标,回答关于流行趋势、内容表现及文案、音频、脚本创作等问题,对创作者免费,重度用户可购买 Meta One 订阅获得更多用量。YouTube 也刚宣布了类似的 AI 创作者数据面板更新。
针对专栏作家 Jason Aten 指控 Meta AI 智能体 Muse 未经许可读取其 Mac 私人信息,Meta 高管 Andy Stone 与 David Singleton 回应称读取信息需开启 Full Disk Access 并经应用与 macOS 系统多层权限确认,即使存在 bug 也无法绕过。
TechCrunch 分析消费级AI的商业困境:截至5月仅2.2%消费者为AI付费、月均31美元,模型性能大幅提升(GPT-5.2到Astra)也未改变付费增长;按Netflix规模的34美元客单价测算年化收入约110亿美元,不足OpenAI运营成本的三分之一。
OpenAI 在 DevDay 上发布由 GPT-6 Astra 驱动的智能体 Dots,定位为可委派长周期知识工作的付费专业工具,暂时仅面向每月 20 美元起的 Pro 及以上订阅用户。
The Verge 报道,Meta 和 OpenAI 正以可爱软件智能体为硬件铺路。Meta 计划在今年假日购物季前推出带屏幕、形似钥匙扣的 Muse Charm 设备;OpenAI 在 DevDay 发布智能体平台 Dots,与 Jony Ive 合作的硬件按公开文件最早 2027 年 2 月出货。
据纽约时报报道,Meta 通过把 AI 数据中心归为“试验模型”、Nvidia 芯片归为实验材料,利用 1981 年联邦研究税收抵免 2025 年省下 39 亿美元,高于前一年的 20 亿和 2023 年的 7 亿美元,是上市公司中最大受益者。
特朗普在宴请六位科技公司负责人后表示,AI 安全由「世界上最聪明的人互相监督」,以自律承诺取代联邦监管,并称相关担忧因其将 AI 改称「超级智能」而不再适用。
Meta 发布 Muse AI 智能体,宣称可代发邮件、在线购物,前提是用户愿把数据和信用卡交给它。Meta 还公布了类似 Tamagotchi 的 Muse Charm 配件、Mac 应用、智能眼镜集成等计划,但产品也出现地址泄露、漏洞被攻击者控制等问题,Amazon 已封禁 Muse 智能体。
John Gruber 评价 Meta 的 Muse:它为每位用户提供运行在 Meta 云端的专属持久 Linux VM,是首个消费者可用的 agentic AI 系统,安装使用简单、以吉祥物形象呈现。但他警告,消费者可能并未意识到 Muse 有多强大、因而多危险,尤其是运行在 Mac 上时。
Latent Space 主笔 swyx 宣布 AINews v3 计划,将合并 Discord 与 AINews 的功能、探索迁移至 Beehiiv,并重新开放赞助(business@latent.space)与 PR/tips 投稿。
Meta 发布 30B 参数开源多模态模型 Muse Glimmer,从 Muse 蒸馏而来,采用 Apache 2.0 许可,定位于本地智能体场景如编码、文档分析和个人助理。
推荐理由:原文给出架构细节、跑分对比和多套部署方案,读者可据此评估其在本地多模态智能体场景的可用性。
多伦多大学、Vector Institute、剑桥大学与 ServiceNow 的研究者构建了一个用开源权重 LLM 驱动的自复制计算机蠕虫原型:被攻陷主机的 GPU 上运行 LLM 进行推理,自主发现漏洞并感染新目标,单 GPU(80GB A100)即可运行且不依赖厂商 API。漏洞检测成功率约 80%,利用约 53%,自复制 88%,完整攻击总体成功率约 37%。
Hugging Face 宣布 OpenEnv 转为由多方委员会协调的开源项目,委员会成员包括 Meta-PyTorch、Unsloth、Modal、Nvidia、Microsoft 等。
Berkeley AI Research 提出 GRASP,一种基于梯度的世界模型规划器,让长时程规划更稳定可靠。其核心做法有三点:把轨迹提升到虚拟状态使优化在时间上并行、在状态迭代中直接引入随机性以实现探索、重塑梯度让动作获得干净的信号并避开脆弱的“状态-输入”梯度。
OpenMed 构建了覆盖结构预测、序列设计与密码子优化的端到端蛋白质 AI 流水线。在对比多种 transformer 架构后,CodonRoBERTa-large-v2 胜出,困惑度 4.10、Spearman CAI 相关性 0.40,显著超过 ModernBERT;团队随后扩展到 25 个物种,用 55 GPU 小时训练了 4 个生产模型,建立了其他开源项目没有的物种条件化系统。
Turing 在 Meta 与 Hugging Face 的开源框架 OpenEnv 上构建了生产级日历管理环境 Calendar Gym,用于在访问控制、时间推理和多智能体协调等真实约束下评估工具调用智能体。
Hugging Face 团队推出 Alyah(意为阿联酋方言中的"北极星"),一个评测阿拉伯语大模型阿联酋方言能力的基准,包含 1,173 个由母语者人工采集的多选题样本,覆盖问候语、诗歌、历史遗产和方言语言等类别。
Meta-PyTorch 与 Hugging Face 联合推出 OpenEnv Hub,一个共享开放的智能体环境社区平台,同时发布 OpenEnv 0.1 规范(RFC)征集社区反馈。
BigCode 发布 BigCodeArena,一个通过真实执行来评判代码生成模型的人类投票平台,支持 10 种语言和 8 种执行环境,开放无需注册。上线 5 个月收集 14K 对话、4700+ 偏好投票,Elo 排名中 o3-mini 和 o1-mini 居首。
推荐理由:基于5个月社区执行评估数据发布代码生成评测平台,给出分语言和执行环境的模型表现差异与两个新基准。
Meta 的 Hugging Face 团队发布 GAIA 后续基准 Gaia2 和配套开源框架 Meta Agents Research Environments(ARE),Gaia2 数据集采用 CC BY 4.0 许可,ARE 采用 MIT 许可。
推荐理由:官方发布新基准 Gaia2 和开源评估框架 ARE,含七类任务和主流模型结果,便于开发者调试和评估自己的 Agent。
Arm 宣布 ExecuTorch 0.7 beta 中 KleidiAI 默认启用,为 Arm CPU 设备带来自动加速,无需开发者改代码。
NVIDIA 的 AI-Q Blueprint 在 Hugging Face DeepResearch Bench「LLM with Search」榜单登顶,总分为 40.52(截至 2025 年 8 月),是目前完全开源授权方案中的第一名。
Hugging Face 发布长文,回顾 2024 年 4 月以来视觉语言模型(VLM)的关键变化与趋势。
推荐理由:Hugging Face 系统梳理了过去一年 VLM 的新架构、多模态 RAG、智能体与安全模型,可作为领域入门与选型参考。
Meta 发布 Llama 4 Maverick(约 400B、128 专家)和 Scout(约 109B、16 专家),均为 17B 激活参数的 MoE 原生多模态模型,在最多 40 万亿 token、200 种语言数据上训练。
推荐理由:官方公告给出两款模型的参数、上下文长度与架构细节,读者可以据此评估部署门槛和与 transformers 的集成方式。
Hugging Face Diffusers 团队发文综述当前开源视频生成模型现状,覆盖 CogVideoX、Mochi-1、HunyuanVideo、LTX Video 等模型及其高资源需求、泛化与延迟等局限。
推荐理由:Diffusers 团队原文梳理了开源视频生成模型现状,并给出实测内存数据和一套可复用的推理与微调优化方法。
Hugging Face 详解 LayerSkip 提出的 self-speculative decoding:用同一模型的浅层生成草稿 token、深层做验证,兼得加速、内存节省与更低延迟。
Hugging Face 与 Atla 推出 Judge Arena 平台,让用户对两个 LLM 评判模型在同一测试样本上的打分与理由进行投票,结果以 Elo 分数汇入每小时更新的公开排行榜。
Llama 3.2 两周前登陆 Hugging Face/Transformers,而 Keras 从第一天起就支持它,可直接从 safetensors 格式的 Hugging Face checkpoint 加载,如 "hf://meta-llama/Llama-3.2-1B-Instruct"。
Hugging Face 发布把 Llama3 8B 微调到 BitNet 1.58 比特(三元权重 -1/0/1)的方法,模型在 HF1BitLLM 组织开源,其中两个在 10B tokens 上训练、一个在 100B tokens 上训练,MMLU 成绩超过 Llama 1 7B。
这篇 Hugging Face 教程讲解如何在 Google Cloud A3 节点(8 x H100)上,用 TGI 的 Deep Learning Containers 在 Vertex AI 上部署 Meta Llama 3.1 405B 的 FP8 量化版 Meta-Llama-3.1-405B-Instruct-FP8。
Meta 发布 Llama 3.1 系列,在 Hugging Face Hub 上线 8B、70B、405B 三个规模共 8 个开放权重模型,上下文长度提升至 128K tokens,支持 8 种语言和工具调用。
推荐理由:官方发布说明覆盖了三个规模、内存需求和量化权重,读者可以据此选择适合自己硬件的部署与微调路径。
Meta 发布开源评测框架 CyberSecEval 2,用于评估 LLM 在生成不安全代码、提示词注入、协助网络攻击、代码解释器滥用和自动化攻击能力等方面的安全风险。评测显示,LLM 平均协助网络攻击的合规率已从上一版的 52% 降至 28%;提示词注入防护仍未解决,模型在端到端漏洞利用上能力有限。全部代码开源,并提供 leaderboard,欢迎社区贡献。
Meta 发布 Llama 3 开源模型,提供 8B 和 70B 两种规模,各有 base 与 instruct 版本,并附基于 Llama 3 8B 微调的 Llama Guard 2,全部上架 Hugging Face Hub。
推荐理由:官方发布说明完整给出模型规格、许可证变化和部署微调路径,读者可据此评估升级与迁移成本。
开源人形机器人 Reachy 的开发商 Pollen Robotics 发布开源库 pollen-vision,提供面向机器人的零样本视觉模型统一接口,无需训练即可开箱使用。
Hugging Face 发布面向非工程师的教程,用 Spaces、AutoTrain 和 ChatUI 三个工具,无需写代码即可微调 Llama 2 并部署聊天应用。教程分三步:创建 AutoTrain Space、用 Alpaca 指令数据集微调模型(示例用 7b 基座模型)、再用 ChatUI 模板部署成可分享的聊天应用。
Hugging Face 发布了一项针对 Llama 2 在 Amazon SageMaker 上部署的基准测试,分析了 60 种不同部署配置。测试覆盖 7B、13B、70B 三种参数规模,在 g5 与 p4d 系列 EC2 实例上,以 1/5/10/20 并发请求,比较有无 GPTQ 4-bit 量化的延迟与吞吐。
Hugging Face 团队发布教程,讲解如何用 PyTorch FSDP 在 2 节点共 16 张 A100 80GB 上全参数微调 meta-llama/Llama-2-70b-chat-hf,训练耗时约 13.5 小时。
Hugging Face 发布 Code Llama 系列开源代码模型集成,含 7B、13B、34B 三种规格,基于 Llama 2 在 500B token 代码数据上训练,提供 Python 特化版和指令微调版。
推荐理由:官方完整介绍了模型规格、上下文扩展原理和生态接入方式,读者可以直接据此选择规格并上手部署使用。
Hugging Face 官方博客介绍 TRL 库新支持的 DPO 方法,无需奖励模型和 RL 步骤即可直接在偏好数据上优化语言模型。
推荐理由:原文提供了从 SFT 到 DPO 微调 Llama v2 的完整代码与训练脚本,读者可复用到自己的数据集上。