Photoroom 详解 PRX 系列第四篇:文生图模型的预训练数据策略
Photoroom 发布 PRX 系列第四篇博客,详解其 7B 文生图模型的预训练数据策略,包括用 Lance 建库、Mosaic Streaming(MDS)供流、分辨率与长宽比分桶等核心环节。
Photoroom 发布 PRX 系列第四篇博客,详解其 7B 文生图模型的预训练数据策略,包括用 Lance 建库、Mosaic Streaming(MDS)供流、分辨率与长宽比分桶等核心环节。
Hugging Face 发布教程,用一条 hf jobs run 命令即可在 HF 基础设施上启动私有 OpenAI 兼容的 vLLM 端点,无需配置服务器或 Kubernetes,按秒计费(a10g-large 为 $1.50/hour)。
推荐理由:官方教程给出一条命令在 HF Jobs 上起 vLLM 服务的完整路径,含定价、权限、SSH 调试和接 coding agent 等可复用细节。
NVIDIA NeMo AutoModel 构建在 HuggingFace Transformers v5 之上,只需更改一行 import 即可微调 MoE 模型,相比最优的 v5 配置训练吞吐提升 3.4-3.7x、GPU 显存降低 29-32%。
Google Chrome 团队的 Thomas Steiner 在 Transformers.js 中实验了尚处早期提案阶段的 Cross-Origin Storage API。
Hugging Face 在官方博客详解如何把 huggingface_hub 的发布节奏从每 4 到 6 周一次提升到每周一次,整条流程跑在一个 GitHub Actions 工作流里,使用开源工具、开源权重模型(当前为 Z.ai 的 GLM-5.2)和 HF Inference Providers,单次发布的模型成本约 $0.25。
推荐理由:Hugging Face 官方复盘自身发布流水线,给出可复用的确定性校验加人工把关模式,其他开源维护者可以照搬适配。
Jason Liu 分享了使用 OpenAI Codex 处理长时间运行任务的经验。他利用 Codex 保存上下文、管理复杂项目,让工作在单个提示词之外持续进行。
Hugging Face 博客介绍了 localpager 系统,用 pi agent harness 加受限只读 shell reposhell,在 NVIDIA GB10(DGX Spark。
推荐理由:作者分享了本地模型加受限 shell 做高吞吐分类的完整配方,附带 330 条评测对比,可迁移到其他信息过滤场景。
AWS 开源 SDK Strands Robots 将 LeRobot 栈封装为 AgentTools,可用单个 Strands agent 完成录制演示数据、运行策略、部署到实体 SO-101 和多机器人协调。
推荐理由:AWS 官方 walkthrough 给出从 Hub 数据集到实体 SO-101 机器人的完整可运行示例,仿真与硬件共享同一 LeRobotDataset 格式,可迁移到自己的机器人工作流。
天体物理学家 Chi-kwan Chan 使用 OpenAI 的 Codex 构建黑洞模拟,帮助科学家研究极端物理现象并检验爱因斯坦广义相对论。Codex 在其科研工作流中承担模拟构建工作,将 AI 编程能力引入天体物理研究。
Hugging Face 博客发布 PyTorch 性能分析系列第二篇,从 nn.Linear 逐步剖析到 GeGLU MLP 的性能分析。
推荐理由:文章用逐级 profiler 对照讲清 bias 折叠、视图与内核命名,读者可以迁移这套方法去分析自己的 PyTorch trace。
Hugging Face 工程师让一个编码 Agent 通过调用两个 Spaces(ideogram-ai/ideogram4 图像生成和 VAST-AI/TripoSplat 单图转 3D Gaussian splat)搭建了巴黎地标 3D 画廊 mishig/monuments-de-paris,全程未手动使用图像生成或 3D 工具。
推荐理由:作者亲历一次完整流水线复现,给出可复用的 agents.md 调用方法和链式组合思路,读者可照做搭建自己的多媒体 Agent 应用。
Hugging Face 发布教程,教你把 GitHub Actions CI 任务改由 HF Jobs 执行,只需将 runs-on 改为 hf-jobs-* 标签,通过 dispatcher Space 和 GitHub App 桥接即可。
推荐理由:Hugging Face 官方给出把 GitHub Actions CI 迁到 HF Jobs 的完整步骤,并用 Trackio 实测数据说明 CPU 提速约 30% 和低成本 GPU CI 的可行路径。
Hugging Face 在 DharmaOCR 训练中把 DPO 用于聊天对齐之外的场景:用模型自身失败产生的退化循环构建拒绝对,作为第二训练阶段降低结构化 OCR 的文本退化率。
IBM 在四个企业场景(Cobol/PL/1 遗留代码理解、Aster 测试生成、事件响应等)中验证:在智能体层加入程序分析、知识图谱等 agent logic,可约束 LLM 的上下文空间。
Braintrust 工程师使用 Codex 与 GPT-5.5 将客户需求转化为代码。借助这一组合,团队能够更快地运行实验和编写代码。
Hugging Face 发布 PyTorch 性能分析系列教程第一篇,面向初学者讲解 torch.profiler 的设置与使用。
Hugging Face 发布教程,教 Reachy Mini 用户用 speech-to-speech 库跑通完全本地的语音对话管线,音频不再上传服务器,无需云端和 API key。
Hugging Face 发布 AI Agent 术语表,解释 agent 领域常被混用的术语,核心区分是模型、脚手架与 harness 三层。
Ramp 工程师使用搭配 GPT-5.5 的 Codex 进行代码审查并发布改进,将获得实质性反馈的时间从数小时缩短到数分钟。
Google DeepMind 发布复盘,其 AI 气象模型 WeatherNext 帮助美国国家飓风中心提前五天以 80% 置信度预测飓风 Melissa 将以五级强度登陆牙买加,三天前置信度升至接近 100%。
推荐理由:官方复盘了 WeatherNext 提前五天高置信度预测飓风 Melissa 强度跃升的过程,读者可以了解 AI 气象模型在路径与强度预测上的实际表现。
ChatGPT Work 提供一套实操工作流,覆盖立项简报、战略更新、决策包和进度汇报等运营场景,帮助团队在具体工作中直接使用 ChatGPT。
Hugging Face 讲解如何将 CPU 与 GPU 工作负载分离,实现异步 continuous batching 以提升 LLM 推理性能。在使用 8B 模型、batch size 32 生成 8K token 的测试中,同步批处理有 24.0% 的时间 GPU 处于空闲等待,总耗时 300.6 秒;消除 CPU 开销可带来约 24% 的免加速。
OpenAI 构建了一个安全沙箱,使 Codex 能够在 Windows 上运行,并通过受控的文件访问和网络限制来保障安全。
OpenAI 介绍 ChatGPT Work 在财务场景中的实用工作流,涵盖报告、差异分析、预测、月度复盘及可直接用于决策的财务交付物。文章属于实操指南,重点展示如何把这些日常财务任务交给 ChatGPT Work 处理。
Hugging Face 与 AWS 分析了基础模型预训练、后训练和推理生命周期所需的基础设施,提出由加速计算、高带宽低延迟网络和分布式存储构成的分层架构。
OpenAI 探讨企业如何把 AI 从早期试验推进到规模化复利影响,关键在于建立信任、完善治理、优化工作流设计,并在规模化中保证质量。
PipelineRL 在从 vLLM V0(0.8.5)迁移到 V1(0.18.1)时发现 train-inference 不匹配,影响 GSPO 训练的 clip rate、KL、entropy 和 reward。
OpenAI 重构了其 WebRTC 技术栈,以支持低延迟、全球规模的实时语音 AI,并实现流畅的对话轮换。这套架构让语音智能体在生产环境中可以稳定运行。
OpenAI 本周在 Hub 上开源发布 Privacy Filter,一个 PII 检测模型,1.5B 参数、50M 激活参数,Apache 2.0 许可,支持 128k 上下文单次前向识别 8 类个人信息,在 PII-Masking-300k 基准上达到 SOTA。
ChatGPT Work 提供面向日常工作的实用工作流,覆盖重复性任务、更新汇报、调研、规划以及团队协作运营等场景,帮助用户将这些常见工作环节交给 ChatGPT 处理。
Hugging Face 发布教程,指导开发者在 Manifest V3 约束下用 Transformers.js 在 Chrome 扩展中运行本地 AI,并复刻其 Gemma 4 Browser Assistant 架构。
推荐理由:作者基于自家 Gemma 4 浏览器扩展拆解 MV3 下运行 Transformers.js 的架构决策,给出可直接迁移的运行时划分与消息契约设计。
OpenAI 介绍如何在 ChatGPT 中构建和使用工作区智能体(workspace agents),用于自动化可重复的工作流。这些智能体可连接各类工具,简化团队运营流程。
Hugging Face 发布一个 Skill 和独立测试套件,帮助贡献者把 transformers 模型移植到 mlx-lm,模型进入 transformers 后可更快在 MLX 上可用。
推荐理由:原文给出一个可复用的 Skill 加非智能体测试套件,并总结了让智能体 PR 符合开源惯例的具体规则,可迁移到其他项目。
Hugging Face 博客讲解如何用 Sentence Transformers 训练和微调多模态嵌入与重排模型,以 Qwen/Qwen3-VL-Embedding-2B 在 Visual Document Retrieval 任务上微调为例。
推荐理由:作者用 Qwen3-VL 完整走通多模态嵌入微调流程,NDCG@10 从 0.888 提到 0.947,方法可直接迁移到自己的领域数据。
OpenAI 讲解如何使用 ChatGPT 探索数据集、生成洞察、创建可视化,并将分析结果转化为可执行的决策。
ChatGPT 支持多种文件处理工作流,包括从文档中查找信息、整理文件内容、转换文件格式,以及把文档融入日常工作流程。
运营团队正使用 ChatGPT 精简工作流程、改善协作协调、标准化流程,并推动更快执行。
ChatGPT 支持通过清晰的提示词创建和优化图像,用户可以不断迭代设计,几分钟内生成高质量视觉内容。
ChatGPT 可帮助营销团队规划营销活动、创建内容并分析表现,通过实用的 AI 工作流把洞察转化为行动。
OpenAI 发布 AI 负责任使用指南,围绕使用 ChatGPT 等工具时的安全性、准确性与透明度给出最佳实践。