在 AWS 上为 Claude Platform 实现多环境访问
AWS 指南介绍了为 Claude Platform on AWS(CPonAWS)配置生产、开发者和外部环境三类访问的完整实现。方案在专用 AI Services 账户中托管订阅,通过跨账户 SigV4 支持工作负载免存 API 密钥调用,开发本地使用 workspace 级 API key 配合 Anthropic SDK,外部环境则经 OIDC 联合认证获取短期凭证,实现零持久凭证。
AWS 指南介绍了为 Claude Platform on AWS(CPonAWS)配置生产、开发者和外部环境三类访问的完整实现。方案在专用 AI Services 账户中托管订阅,通过跨账户 SigV4 支持工作负载免存 API 密钥调用,开发本地使用 workspace 级 API key 配合 Anthropic SDK,外部环境则经 OIDC 联合认证获取短期凭证,实现零持久凭证。
AWS 在 Amazon Bedrock AgentCore 上给出了一套环境智能体(ambient agent)的端到端参考实现:智能体由 S3 事件等信号触发,在 AgentCore Runtime 上运行,并通过单一 ask_human 工具暂停等待人工批准或澄清后再继续。
Amazon Payments 团队介绍用 LinUCB 上下文多臂 bandit 在 Amazon SageMaker AI 上对获客漏斗做全流程个性化,每个漏斗阶段(开始、提交、批准)各建一个模型并按权重合成 UCB 分数。七周 A/B 测试中一个人群的最终转化获得高个位数相对提升,另一个人群无改善,问题出在内容池而非模型;文章附可在 SageMaker AI 上用合成数据动手实验的代码仓库。
这篇教程展示如何在 NVIDIA NeMo Agent Toolkit(NAT,测试版本 1.6)中把 Amazon S3 Vectors 实现为自定义持久记忆提供者,并部署在 Amazon EKS 上,以多智能体投资研究为示例。
Microsoft Research 开发了一套机器学习系统,可对美国大陆 66,935 座变电站生成位置级空间天气风险预测。系统结合 AE、Dst 指数预测、太阳风观测与当地地质导电率,能提前 30-60 分钟向电网运营商发出警告。在 2020-2026 评估期内,系统对重大事件(≥10 nT/min)检出率 76.5%,严重事件 81.2%,极端事件 64.1%。
Amazon Bedrock Knowledge Bases 可为保险理赔文件构建对话式查询助手,通过 AgenticRetrieveStream API 将多部分问题拆解为子查询并多轮检索,直至证据充分后生成带引用的答案。
AWS 博客发布实操教程,用 Amazon Bedrock AgentCore Runtime Instances 部署三个智能体(作曲、交付、合规)协作的音乐制作流水线。
Simon Willison 发布实验性工具 Photo Scrubber,用于识别照片中陌生人脸并自动模糊,避免分享抗议照片时暴露陌生人的可识别面部。工具由 GPT-6 Astra 构建,基于 Google 的 MediaPipe C++ 库经 @mediapipe/tasks-vision 编译为 WebAssembly,并使用 BlazeFace 人脸检测模型。
AWS 发布 Amazon Quick 提示词工程指南,讲解如何通过结构化提示词提升平台 AI 功能回答自然语言请求的准确性。文章介绍清晰具体、提供业务上下文、示例演示(few-shot learning)等核心原则,并给出 CRISPE 通用提示词框架。这是两篇系列的第一篇,第二篇将深入 Research、Flows、Sight、Chat Agents 等组件的专项技巧。
AWS 撰文逐组件解析 Amazon Quick 的提示词写法:Quick Research 需明确目标、受众和关注领域,并从 200+ 新闻源及 S&P Global。
AWS 展示了一套合同智能平台架构,将数百份合同 PDF 转为结构化、可查询数据,解决 RAG 无法跨全量数据聚合的问题。平台由 Claude Sonnet 驱动的提取 agent 抽取八个关键字段,Claude Haiku 驱动的验证 agent 独立复核,签名分歧时由 Amazon Textract 做确定性裁定,结果存入 Amazon Aurora PostgreSQL。
Condé Nast 与 AWS Generative AI Innovation Center 合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频发现方案,将 14 万多条视频库的检索时间从平均每次任务 250 分钟降至 2 分钟以内。
AWS 在 Amazon SageMaker AI 上通过 vLLM-Omni DLC 部署 Qwen3-TTS,实现文本流式输入、语音边生成边播放的实时输出。
这篇教程演示在 Amazon SageMaker AI 上用同一个 AWS vLLM-Omni DLC 部署两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 将图像生成为视频,MP4 结果存入 Amazon S3。
AWS 在 Machine Learning Blog 上展示了用 Amazon Nova Act 与 Amazon Bedrock AgentCore 构建智能体驱动的合成监控方案,模拟登录、结账等关键用户旅程,替代依赖 DOM 选择器、易因 UI 变化失效的 Selenium/Playwright 脚本。
Simon Willison 在 WeAreDevelopers World Congress North America 闭幕演讲前,用三张鸮鹦鹉照片和一段提示词让 Claude Opus 5.5 生成了 HTML5 canvas 像素风鸮鹦鹉派对动画页面。
GitHub Copilot app 的 canvases 功能让用户用 /create-canvas 技能以自然语言描述生成看板、清单等自定义界面,无需编码。画布是双向共享的,用户和 Agent 可同时操作并实时同步状态,创建后可作为扩展保存供个人或团队复用,社区还通过 Awesome Copilot 提供了现成的 canvas 扩展。
聊天仍是与 LLM 交互的主要方式,但作者认为在多数场景下 chat 并非合适的 UI。GitHub Copilot app 中的 canvas 是一个可与 agent 双向通信的全栈小应用,既能调用第三方 API,也能在本地执行代码,文中演示了用它玩 Connect 4、管理 Winget 包、操作 SQLite 数据库以及自动化开发工作流。
GitHub Security Lab 的 Antonio Morales 发布开源 Fuzzing Taskflow,基于 Taskflow Agent 为 C/C++ 项目提供自主模糊测试流水线。
推荐理由:作者亲述设计取舍,读者可以照着跑起来,并理解 LLM 智能体如何接管模糊测试中重复的人工环节。
GitHub 团队在 GitHub Copilot 应用中重建了 pull request 视图,以支持超大规模 diff 的流畅浏览。他们测试了一个含 2200 个文件、超过一百万行变更和 400 多条行内评论的开源 PR,通过将高度拆分为确定性代码几何与动态块几何两套体系,解决了评论高度只有渲染后才能测量的问题。团队还定义了健康指标并持续进行自动化测量与改进循环。
这是一份通过交互式示例讲解 shadow DOM 的教程,演示了样式封装、继承、slots、parts 以及 JavaScript 访问等机制。Shadow roots 会创建隔离的 DOM 树,拥有私有样式表,其元素以特定且受控的方式与页面 DOM 交互。该示例 artifact 由 Fable 5.1 Medium 根据一段提示词构建。
Simon Willison 与 Jesse Vincent 将于 10 月 14 日(周三)在旧金山合办一场关于 Agentic Engineering 的晚间交流活动,面向用 coding agents 构建有趣项目的人。活动以非正式的 show-and-tell 和开放式对话为主,鼓励分享尚未公开的实验和未完成项目,不要求演讲,也不接受产品推销。
MIT Technology Review 与 Times of San Diego 联合发布方法说明,介绍其15个月调查如何首次系统绘制美国边境监控塔附近的移民死亡地图。
IBM Research 在 ALTK-Evolve 中推出 Consistency Analyzer 和一致性指南,针对智能体重复执行同一任务的稳定性问题。
GitHub 日本和韩国营销负责人分享如何用 GitHub Copilot 将活动运营自动化,从单个 GitHub Issue 出发完成建页、邀请邮件、报名筛选和会后报告,把原本需数天的手工流程压缩到几分钟。
GitHub Copilot app 新增 diff、terminal 和 browser 三个内置面板,让用户在不离开应用的情况下审查 AI 智能体的代码改动、运行命令并预览效果。
Hugging Face 博客介绍 TRL v1.14 的 AsyncGRPOTrainer 支持 LoRA 训练并仅向 vLLM 同步几 MB 的 adapter,训练与推理以独立 HF Jobs 运行,通过 Storage Bucket 挂载共享 adapter,前置代理负责加鉴权头、按 KV 前缀路由 rollout 并向所有副本广播 adapter 加载。
推荐理由:原文给出了跨机 LoRA GRPO 的完整架构与五轮瓶颈调优数据,500 步从 3 小时 27 分压到 53 分钟,方法可直接复用。
Mistral 帮助一家欧洲能源运营商把 40 万行 Fortran 77 油藏模拟器中的首期 4 万行迁移到 C++,先搭建数值对齐校验框架导出 Fortran 状态并用 C++ 测试框架验证。
GitHub Copilot app 支持同时运行多个 AI 智能体,各会话相互独立、互不干扰。每个会话可运行在各自的 Git worktree 上并保留独立上下文,并行执行不同任务。开发者可在 sessions 视图跟踪进度,把时间花在审查和决策上,无需逐个等待任务完成。
Hugging Face 工程师用 TRL 和 OpenEnv 开源复现了 Surya Narreddi 的项目:训练语言模型写 JavaScript(通过 p5.brush)绘制水彩画。
Hugging Face 发布教程,展示用 TRL 库以 GRPO 微调 LiquidAI/LFM2.5-350M 提升结构化输出合规率。训练仅用约 500 样本和 100 步,可在免费版 Colab 或 Kaggle GPU 上运行,评测经 llama.cpp 在 MacBook 本地完成。
推荐理由:原文给出完整可复现的 GRPO 微调流程和量化前后对比,读者可以用同样低成本方法提升小模型的结构化输出合规率。
Sentence Transformers v6.0 引入第四种模型类型 MultiVectorEncoder,支持 ColBERT 式后期交互检索及完整训练流程。
推荐理由:作者实测比较了六种训练起点和各训练超参,给出可在单张消费级 GPU 上数小时完成的完整多向量模型微调配方。
Hugging Face 在 Gradio 中推出 gr.Workflow,把 AI 应用的多步骤流水线描述为类型化节点图,并提供可拖拽画布,每个节点可运行、中间结果可见。
推荐理由:原文来自官方,给出 gr.Workflow 的节点图机制、多个可复制的在线示例和 REST API 用法,读者可以直接上手复用这套搭建 AI 流水线的方法。
Hugging Face 团队详解 Papers with Code 混合搜索架构:PostgreSQL 全文检索加 pgvector 语义召回,经加权 RRF 融合,语义向量用 Qwen/Qwen3-Embedding-0.6B 生成 256 维 Matryoshka 截断向量。
IBM Research 在 Hugging Face 博客发布 ALTK-Evolve 研究,在 AppWorld 上测试八种模型后提出智能体记忆应按模型能力校准注入剂量,而非全量累积。
Hugging Face 发布教程介绍 Sentence Transformers v6.0 新增的第四种模型类型 MultiVectorEncoder,用于 ColBERT 式 late interaction 检索。
推荐理由:官方教程详解 Sentence Transformers v6.0 新增 MultiVectorEncoder 的用法,涵盖 MaxSim 原理、索引成本与视觉文档检索实践。
Hugging Face 构建了一个约束感知 GPU 分配器,在 7 个基准场景中与 FIFO 调度器对比。相同硬件和负载下,利用率从 52–85% 提升至 72–88%,最高提升 33 个百分点;优先级加权产出每个场景均上升,增幅 24.6%–105.1%,平均 52%。最强案例是 8 GPU 的训练密集型负载:利用率从 53.6% 升至 87.0%,产出提升 105%。
Strands Robots 推出流式数据环,在一个 Agent 内完成录制机器人演示、直接从 Hub 流式读取训练、再把 checkpoint 部署回硬件,全程保持 LeRobot 格式。
IBM Research 在博客中对比自家的 ALTK-Evolve 与 ACE 两种智能体记忆方法,两者都不压缩经验教训,差异在于交付:ACE 每步注入完整 playbook,ALTK-Evolve 按任务和模型能力检索适量 guideline。
IBM Research 团队在博文中提出,模型路由不是分类问题而是系统优化问题。他们在 AppWorld Test Challenge 上用同一 CodeAct agent 跑 417 个任务。
推荐理由:作者基于 417 个 AppWorld 任务的一手实测说明标价、缓存和基础设施如何左右路由成本,并把路由从分类问题转为优化问题,方法可迁移。