跳到正文

#部署/工程

今日 4 条
今天10月2日周五
  1. AWS Machine Learning Blog43

    在 AWS 上为 Claude Platform 实现多环境访问

    AWS 指南介绍了为 Claude Platform on AWS(CPonAWS)配置生产、开发者和外部环境三类访问的完整实现。方案在专用 AI Services 账户中托管订阅,通过跨账户 SigV4 支持工作负载免存 API 密钥调用,开发本地使用 workspace 级 API key 配合 Anthropic SDK,外部环境则经 OIDC 联合认证获取短期凭证,实现零持久凭证。

  2. AWS Machine Learning Blog54

    Amazon Payments 在 AWS 上用多目标上下文 bandit 优化获客转化漏斗

    Amazon Payments 团队介绍用 LinUCB 上下文多臂 bandit 在 Amazon SageMaker AI 上对获客漏斗做全流程个性化,每个漏斗阶段(开始、提交、批准)各建一个模型并按权重合成 UCB 分数。七周 A/B 测试中一个人群的最终转化获得高个位数相对提升,另一个人群无改善,问题出在内容池而非模型;文章附可在 SageMaker AI 上用合成数据动手实验的代码仓库。

10月1日周四
  1. Microsoft Research43

    Microsoft Research 用机器学习预测电网的空间天气风险

    Microsoft Research 开发了一套机器学习系统,可对美国大陆 66,935 座变电站生成位置级空间天气风险预测。系统结合 AE、Dst 指数预测、太阳风观测与当地地质导电率,能提前 30-60 分钟向电网运营商发出警告。在 2020-2026 评估期内,系统对重大事件(≥10 nT/min)检出率 76.5%,严重事件 81.2%,极端事件 64.1%。

9月30日周三
  1. AWS Machine Learning Blog37

    用 Amazon Quick 和 Amazon Bedrock AgentCore 构建AI驱动的合同智能平台

    AWS 展示了一套合同智能平台架构,将数百份合同 PDF 转为结构化、可查询数据,解决 RAG 无法跨全量数据聚合的问题。平台由 Claude Sonnet 驱动的提取 agent 抽取八个关键字段,Claude Haiku 驱动的验证 agent 独立复核,签名分歧时由 Amazon Textract 做确定性裁定,结果存入 Amazon Aurora PostgreSQL。

9月29日周二
9月28日周一
9月24日周四
  1. GitHub Blog · AI & ML48

    GitHub Copilot 应用如何渲染超大型 Pull Request

    GitHub 团队在 GitHub Copilot 应用中重建了 pull request 视图,以支持超大规模 diff 的流畅浏览。他们测试了一个含 2200 个文件、超过一百万行变更和 400 多条行内评论的开源 PR,通过将高度拆分为确定性代码几何与动态块几何两套体系,解决了评论高度只有渲染后才能测量的问题。团队还定义了健康指标并持续进行自动化测量与改进循环。

  2. Google DeepMind43

    Google Private AI Compute 将引入安全的服务端持久记忆

    Google Private AI Compute 团队宣布为其平台增加私密的服务端持久 AI 记忆能力。用户数据保存在云端加密存储中,解密密钥仅存于个人设备,模型在硬件隔离的 secure enclave 中临时解密处理后再加密,连 Google 也无法访问。配套措施包括更新技术白皮书、防篡改的公开软件记录及第三方网络安全公司独立审计结果。

9月22日周二
9月21日周一
  1. NVIDIA Blog47

    NVIDIA:AI 安全是一个工程问题——如何在 Agent 技术栈的每一层解决它

    NVIDIA 提出 AI 安全应作为工程问题来对待,需要明确的防护要求、可执行的控制措施、指定负责人和防护有效的证据。安全防护应覆盖模型、harness 和运行环境的完整 Agent 技术栈,NVIDIA 开源的 OpenShell 提供了在 Agent 之外执行策略的沙箱运行时,Cisco 的 DefenseClaw 和 JFrog 在其上构建治理与技能扫描能力。

  2. Hugging Face Blog71

    Hugging Face 发布 tokenizers v1 候选版,编码速度较 v0.23 提升至 3 到 30 倍

    Hugging Face 发布 tokenizers v1 的 release candidate,在 Apple M4 Max 单线程上编码速度比 v0.23 快 3 到 30 倍(低端 t5-base,高端 gpt2),八线程扩展达线性的 76%。

    推荐理由:Hugging Face 官方实测数据说明 tokenizers v1 为何能比 v0.23 快 3 到 30 倍,读者可以借此判断升级对训练和推理工作流的影响。

9月19日周六
9月17日周四
  1. GitHub Blog · AI & ML69

    GitHub 用 Copilot 将 Copilot agent runtime 迁移到 80 余万行 Rust

    GitHub 用 Copilot agent 将 Copilot agent runtime 从 TypeScript 完整重写为 832,378 行生产 Rust,AI 编写了大部分代码,历时约 14.5 周、128 个 PR,采用原地逐组件替换而非一次性切换,性能有数量级提升。

    推荐理由:一手复盘给出原地迁移策略、缓存命中率与子会话协作细节,对规划大规模 agent 辅助重写有可借鉴方法。

9月16日周三
9月10日周四
  1. Hugging Face Blog63

    Hugging Face 实践:用 Storage Bucket 和代理跨 HF Jobs 跑 Async GRPO + LoRA,无需 NCCL

    Hugging Face 博客介绍 TRL v1.14 的 AsyncGRPOTrainer 支持 LoRA 训练并仅向 vLLM 同步几 MB 的 adapter,训练与推理以独立 HF Jobs 运行,通过 Storage Bucket 挂载共享 adapter,前置代理负责加鉴权头、按 KV 前缀路由 rollout 并向所有副本广播 adapter 加载。

    推荐理由:原文给出了跨机 LoRA GRPO 的完整架构与五轮瓶颈调优数据,500 步从 3 小时 27 分压到 53 分钟,方法可直接复用。

9月3日周四
  1. Google DeepMind43

    Google DeepMind 推出 Fairwind 计划:以 Gemini 3.8 Flash Cyber 提供主动网络防御

    Google DeepMind 推出 Fairwind 计划,向政府机构和受信任的合作伙伴开放先进的网络防御能力。该计划将 Gemini 3.8 Flash Cyber 模型与 CodeMender 结合,可自主查找、验证并修复漏洞,在几分钟内生成就绪的补丁,初始访问面向政府、关键基础设施运营商和核心技术平台。

9月1日周二
  1. Hugging Face Blog60

    Hugging Face 发布 @huggingface/kernels 及 207 个 WebGPU 内核

    Hugging Face WebAI 团队发布 @huggingface/kernels 库和 207 个 WebGPU 内核(Apache-2.0),每个内核以带版本号的独立仓库发布,包含 manifest、正确性测试、基准用例和 WGSL shader 模板。

    推荐理由:官方介绍了 207 个 WebGPU 内核的发布方式和与 ORT WebGPU 的实测对比,读者可以据此评估浏览器端推理优化的可用路径。