在 AWS 上为 Claude Platform 实现多环境访问
AWS 指南介绍了为 Claude Platform on AWS(CPonAWS)配置生产、开发者和外部环境三类访问的完整实现。方案在专用 AI Services 账户中托管订阅,通过跨账户 SigV4 支持工作负载免存 API 密钥调用,开发本地使用 workspace 级 API key 配合 Anthropic SDK,外部环境则经 OIDC 联合认证获取短期凭证,实现零持久凭证。
AWS 指南介绍了为 Claude Platform on AWS(CPonAWS)配置生产、开发者和外部环境三类访问的完整实现。方案在专用 AI Services 账户中托管订阅,通过跨账户 SigV4 支持工作负载免存 API 密钥调用,开发本地使用 workspace 级 API key 配合 Anthropic SDK,外部环境则经 OIDC 联合认证获取短期凭证,实现零持久凭证。
AWS 博客发布实操教程,用 Amazon Bedrock AgentCore Runtime Instances 部署三个智能体(作曲、交付、合规)协作的音乐制作流水线。
Amazon Bedrock 宣布在印度通过地理跨区域推理提供 Anthropic 的 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5,请求仅在 ap-south-1(孟买)和 ap-south-2(海得拉巴)两个区域间路由,满足数据本地处理需求。
Amazon Bedrock 现支持 Anthropic Claude 模型区域内推理:首尔区域提供 Claude Opus 5 和 Claude Sonnet 5,新加坡区域提供 Claude Sonnet 5。
AWS 宣布 Claude Sonnet 5.5 可在 Amazon Bedrock 和 Claude Platform on AWS(北美)使用,大多数任务成本更低、速度更快。
推荐理由:原文给出 Claude Sonnet 5.5 在 Amazon Bedrock 的接入方式、适用场景与 Opus 5.5 分工建议,读者可据此规划云端部署与成本。
UK AISI 正在使用 EvalEval 的基础设施公开分享评测结果,以提升评测的可复现性与可验证性。
IBM Research 团队在博文中提出,模型路由不是分类问题而是系统优化问题。他们在 AppWorld Test Challenge 上用同一 CodeAct agent 跑 417 个任务。
推荐理由:作者基于 417 个 AppWorld 任务的一手实测说明标价、缓存和基础设施如何左右路由成本,并把路由从分类问题转为优化问题,方法可迁移。
Hugging Face 发布一个随 kernels 库分发的智能体技能,教编码智能体编写可集成进 transformers 和 diffusers 的生产级 CUDA 内核。
推荐理由:原文给出技能安装方法、覆盖内容和 H100 实测数据,读者可以照此让编码智能体生成并发布 CUDA 内核。
Google Research 发布论文《Towards a Science of Scaling Agent Systems》,通过 180 种智能体配置的受控评测,挑战了“智能体越多越好”的假设。
推荐理由:原文用 180 种配置给出多智能体系统何时有效何时退化的量化规律,为架构选择提供了可依据的任务属性判断方法。
Hugging Face 发布 upskill 工具,用 Claude Opus 4.5 生成和评估 agent 技能,再供更小、更便宜或本地模型使用。流程为用 Claude Code 完成任务并导出 trace、从 trace 生成 SKILL.md 技能文件并自动生成测试用例,然后用 upskill eval 对比模型有无技能的表现。
推荐理由:原文给出了用大模型生成技能再迁移到小模型的完整流程和实测数字,方法可直接复用于领域任务。
BigCode 发布 BigCodeArena,一个通过真实执行来评判代码生成模型的人类投票平台,支持 10 种语言和 8 种执行环境,开放无需注册。上线 5 个月收集 14K 对话、4700+ 偏好投票,Elo 排名中 o3-mini 和 o1-mini 居首。
推荐理由:基于5个月社区执行评估数据发布代码生成评测平台,给出分语言和执行环境的模型表现差异与两个新基准。
OpenAI 和 Anthropic 公布了一次首创性的联合安全评估结果,双方互相测试对方模型。评估覆盖模型失准、指令遵循、幻觉、越狱等多个维度,展示了进展、挑战以及跨实验室协作的价值。
Hugging Face 发布教程,介绍如何把 Claude 连接到 Hugging Face MCP Server,用 Spaces 上的图像生成模型出图。2025 年 10 月更新后需通过 Add custom connector 设置 Remote MCP server URL 为 https://huggingface.co/mcp?
Hugging Face 与 Atla 推出 Judge Arena 平台,让用户对两个 LLM 评判模型在同一测试样本上的打分与理由进行投票,结果以 Elo 分数汇入每小时更新的公开排行榜。
Artificial Analysis 与 Hugging Face 合作上线 LLM Performance Leaderboard,覆盖 100 多个 serverless LLM API 端点的质量、价格与速度指标。
Hugging Face 发布长文图解 RLHF,将其拆为预训练语言模型、训练奖励模型、用 PPO 微调三个核心步骤。文中说明人类偏好采用排序而非直接打分以降低噪声,奖励函数含 KL 惩罚以防止策略偏离初始模型,并介绍 TRL、TRLX、RL4LMs 等开源工具及代表性论文,同时指出人类标注成本高、标注者分歧等局限。
推荐理由:这篇官方长文把 RLHF 拆解为预训练、奖励模型和 PPO 微调三步,并梳理开源工具与关键论文,适合建立完整认知。