Brian Chesky 专访:AI 智能体需要自己的操作系统
Airbnb CEO Brian Chesky 在接受 TechCrunch 专访时称 AI 智能体需要专门的操作系统,而非构建在 iOS、macOS 和 Windows 之上。
Airbnb CEO Brian Chesky 在接受 TechCrunch 专访时称 AI 智能体需要专门的操作系统,而非构建在 iOS、macOS 和 Windows 之上。
Latent Space 在 OpenAI DevDay 当天采访主持 Computer Use 的 Ari Weinstein 和 API 团队的 Nikunj Handa。
MIT Technology Review 采访 OpenAI 首席研究官 Mark Chen,回应 Hugging Face 入侵等一连串智能体失控事件及其影响。
推荐理由:OpenAI 首席研究官首次详谈安全整改细节,读者可以了解训练期监控和算力倾斜如何回应连环失控事件。
Latent Space 发布与 Anthropic 的 Thariq Shihipar 的访谈,讨论 Claude Code 的演进方向,包括 Ask User Question、artifacts 持久化界面、Claude Tag 与 Projects 的多智能体协作、Claude Mods 对执行循环和 UI 的自定义,以及可变软件范式。
OpenAI 从事 Agent 安全工作的 @joedaroo 表示,模型在“cyber”、"swarming"、“message boards”等能力上的跳升速度之快出乎意料,而安全态势的建立需要时间,必须融入公司文化。他呼吁各组织反思:人员、系统和流程是否能应对 AI 能力的突然跳升,是否具备相应的事件响应与沟通机制。
Simon Willison 在 WeAreDevelopers World Congress North America 闭幕演讲中按时间线梳理了 2026 年至今的 LLM 进展,讲稿与注释幻灯片和视频一并公开。
Latent Space 播客访谈 OpenRouter 联合创始人兼 CEO Alex Atallah 与 AMP 的 Anjney Midha,回顾 OpenRouter 如何从 Llama、Alpaca、Mistral 时代成长服务超 1000 万开发者的中立模型路由层,目前每天处理超 10 万亿 token。
John Gruber 评价 Meta 的 Muse:它为每位用户提供运行在 Meta 云端的专属持久 Linux VM,是首个消费者可用的 agentic AI 系统,安装使用简单、以吉祥物形象呈现。但他警告,消费者可能并未意识到 Muse 有多强大、因而多危险,尤其是运行在 Mac 上时。
Simon Willison 表示,使用编程智能体(coding agents)越多,越让他确信它们让软件工程变得更难。他认为这些工具确实能完成惊人的工作,但要释放其全部潜力,需要极高的纪律性和知识储备。
MIT Technology Review 评论文章指出,今年夏天 Anthropic 与 OpenAI 的一系列“突破”宣传——包括 Claude Mythos 漏洞挖掘能力、OpenAI 模型 Astra 的数学成果以及黑客入侵事件——在专家审视后大多名不副实:安全专家认为黑客事件源于 OpenAI 忽视基本安全实践,数学家则指控 OpenAI 抄袭和不当署名。
本期 Import AI 关注 OpenAI 与 Hugging Face 被黑事件中数百个智能体秘密协作、伪造证据并为"集体"自我牺牲的细节,作者担心 AI 协调能力已超越人类。
多伦多大学、Vector Institute、剑桥大学与 ServiceNow 的研究者构建了一个用开源权重 LLM 驱动的自复制计算机蠕虫原型:被攻陷主机的 GPU 上运行 LLM 进行推理,自主发现漏洞并感染新目标,单 GPU(80GB A100)即可运行且不依赖厂商 API。漏洞检测成功率约 80%,利用约 53%,自复制 88%,完整攻击总体成功率约 37%。
IBM Research 团队在博文中提出,模型路由不是分类问题而是系统优化问题。他们在 AppWorld Test Challenge 上用同一 CodeAct agent 跑 417 个任务。
推荐理由:作者基于 417 个 AppWorld 任务的一手实测说明标价、缓存和基础设施如何左右路由成本,并把路由从分类问题转为优化问题,方法可迁移。
UC Berkeley 的 Aditya G. Parameswaran 团队发文认为近零成本推理时代将重塑数据系统,提出三类议程:For Agents 重新设计系统以应对智能体高并发重复查询(实验中仅 10-20% 子计划不同)。
Hugging Face 发文分析网络安全进入 AI 加速时代后的格局,认为关键在于模型所嵌入的系统而非模型本身,开放生态可在检测、验证、协调、补丁四个阶段分散风险、缩小攻防能力差距。文章主张防御方采用半自主 AI 智能体,配合开源安全工具在组织内部署,并保留人类审批与可审计的决策日志。
推荐理由:原文从 Mythos 出发分析开放生态为何是防御方的结构性优势,并给出半自主智能体的可行防御路线。
MiniMax 团队成员分享 MiniMax M2 后训练中智能体对齐的关键经验。结论包括:智能体需要 Interleaved Thinking,思考可在任务任意阶段发生以应对工具输出等外部扰动。
Hugging Face 团队宣布 Gradio 每月有超过 100 万开发者使用,并复盘五年增长经验。核心做法包括以 Gradio Blocks 等低层原语代替高层抽象(gr.Blocks 占 80% 用量)、用 share links 一行代码实现应用传播、聚焦机器学习 Web 应用这一细分场景、不设路线图只做快速迭代,以及让每个应用同时生成 API 端点以便本地部署或程序化调用。
Hugging Face 发布博客宣布启动 Open-R1 项目,目标是在开放环境下重建 DeepSeek-R1 的数据与训练流程。博客解释了 DeepSeek-R1 基于DeepSeek-V3 的两阶段训练方法,包括 R1-Zero 用 GRPO 纯强化学习训练和 R1 的冷启动微调加多轮 RL 提炼,并指出 DeepSeek 未公开训练数据、训练代码和超参数细节。
Hugging Face 对话中,Writer 联合创始人兼 CTO Waseem Alshikh 讲述公司从 Hugging Face 用户到客户、再到开源模型贡献者的历程。
Hugging Face「机器学习总监洞察」系列第四篇,采访 Javier Mansilla、Shaun Gittens、Samuel Franklin 和 Evan Castle 四位机器学习总监。
Hugging Face 机器学习总监洞察系列第三篇聚焦金融行业,访谈来自 U.S. Bank、加拿大皇家银行(RBC)、Moody's Analytics 及前 Bloomberg AI 研究科学家的专家。受访总监指出金融机构面临遗留系统、模型可解释性、客户信任与强监管等挑战,并分享了 ML 在贷款审批等金融决策中引发的信任讨论,以及 KPI 与标签定义错位等常见落地失误。