跳到正文

#Anthropic

今日 1 条
今天10月2日周五
  1. AWS Machine Learning Blog43

    在 AWS 上为 Claude Platform 实现多环境访问

    AWS 指南介绍了为 Claude Platform on AWS(CPonAWS)配置生产、开发者和外部环境三类访问的完整实现。方案在专用 AI Services 账户中托管订阅,通过跨账户 SigV4 支持工作负载免存 API 密钥调用,开发本地使用 workspace 级 API key 配合 Anthropic SDK,外部环境则经 OIDC 联合认证获取短期凭证,实现零持久凭证。

9月30日周三
9月29日周二
9月22日周二
7月16日周四
  1. Hugging Face Blog67

    模型路由看似简单实则不然:IBM Research 谈如何把路由当系统优化问题

    IBM Research 团队在博文中提出,模型路由不是分类问题而是系统优化问题。他们在 AppWorld Test Challenge 上用同一 CodeAct agent 跑 417 个任务。

    推荐理由:作者基于 417 个 AppWorld 任务的一手实测说明标价、缓存和基础设施如何左右路由成本,并把路由从分类问题转为优化问题,方法可迁移。

2月13日周五
1月28日周三
  1. Hugging Face Blog67

    Hugging Face 发布 upskill 工具:用 Claude 生成 CUDA 内核技能并迁移给开源模型

    Hugging Face 发布 upskill 工具,用 Claude Opus 4.5 生成和评估 agent 技能,再供更小、更便宜或本地模型使用。流程为用 Claude Code 完成任务并导出 trace、从 trace 生成 SKILL.md 技能文件并自动生成测试用例,然后用 upskill eval 对比模型有无技能的表现。

    推荐理由:原文给出了用大模型生成技能再迁移到小模型的完整流程和实测数字,方法可直接复用于领域任务。

10月7日周二
  1. Hugging Face Blog68

    BigCode 发布 BigCodeArena:通过代码执行端到端评判代码生成模型

    BigCode 发布 BigCodeArena,一个通过真实执行来评判代码生成模型的人类投票平台,支持 10 种语言和 8 种执行环境,开放无需注册。上线 5 个月收集 14K 对话、4700+ 偏好投票,Elo 排名中 o3-mini 和 o1-mini 居首。

    推荐理由:基于5个月社区执行评估数据发布代码生成评测平台,给出分语言和执行环境的模型表现差异与两个新基准。

8月27日周三
8月19日周二
11月19日周二
5月3日周五
12月9日周五
  1. Hugging Face Blog64

    Hugging Face 图解 RLHF:用人类反馈强化学习微调语言模型的完整流程

    Hugging Face 发布长文图解 RLHF,将其拆为预训练语言模型、训练奖励模型、用 PPO 微调三个核心步骤。文中说明人类偏好采用排序而非直接打分以降低噪声,奖励函数含 KL 惩罚以防止策略偏离初始模型,并介绍 TRL、TRLX、RL4LMs 等开源工具及代表性论文,同时指出人类标注成本高、标注者分歧等局限。

    推荐理由:这篇官方长文把 RLHF 拆解为预训练、奖励模型和 PPO 微调三步,并梳理开源工具与关键论文,适合建立完整认知。