Hugging Face 开源模型上线 Amazon Bedrock Marketplace
Hugging Face 的热门开源模型现已可通过 Amazon Bedrock Marketplace 部署,共提供 83 个开源模型。
Hugging Face 的热门开源模型现已可通过 Amazon Bedrock Marketplace 部署,共提供 83 个开源模型。
跨学科艺术家 Minne Atairu 分享她如何借助 OpenAI 的视频生成模型 Sora 实现自己的艺术创作愿景。她讲述了 Sora 在其创作过程中扮演的角色与带来的帮助。
Hugging Face 的 Data is Better Together 社区发布 Apache 2.0 许可的文本生成图像偏好数据集 open-image-preferences-v1,包含 10K 偏好对、超 30K 标注响应,由 250 多名社区成员在不到两周内完成。
OpenAI 宣布推出 ChatGPT Pro,官方称此举旨在拓展前沿 AI 的使用范围。材料仅为摘要,未提供更多功能与定价细节。
OpenAI 发布 o1 与 o1-mini 的系统卡,说明模型发布前完成的安全工作。内容涵盖外部红队测试,以及依据 Preparedness Framework 开展的前沿风险评估。
推荐理由:这是 OpenAI 官方对 o1 系列发布前安全工作的系统说明,涵盖外部红队测试和前沿风险评估框架的具体执行。
Hugging Face 博客作者搭建了一个 Keras chatbot arena,用 Gradio、Spaces、JAX 和 TPU 测试 LLM 在对话中被指出错误后能否自行修复。
Google 发布视觉语言模型 PaliGemma 2,将 SigLIP 图像编码器与 Gemma 2 语言模型结合,提供 3B、10B、28B 三种规模,支持 224x224、448x448 和 896x896 三种输入分辨率。
推荐理由:Google 发布 PaliGemma 2 视觉语言模型,提供 3B、10B、28B 三种规模与多分辨率选择,并附 transformers 集成和微调脚本。
OpenAI 与专业媒体平台 Future 宣布达成战略合作,将 Future 旗下 200 多个媒体品牌的内容带给 OpenAI 的用户。
Morgan Stanley 使用 AI evals 来塑造金融服务的未来。通过与 OpenAI 的合作,该公司将 AI 评测体系应用于金融服务场景,以评估和改进 AI 在实际业务中的表现。
Hugging Face 发布面向阿拉伯语 LLM 的生成式评测基准与排行榜 AraGen,并推出新的 NLG 评测指标 3C3H。3C3H 基于 LLM-as-judge,从正确性、完整性、简洁性、有用性、诚实性与无害性六个维度评估模型回答,兼顾事实性与可用性。排行榜采用动态评测:数据集和评测代码先私有盲测三个月,到期后公开并更换新数据集,以缓解数据污染问题。
Hugging Face 与 Capital Fund Management(CFM)分享如何用 Llama 3.1-70b 通过 Inference Endpoints 辅助标注 FNSPID 金融新闻数据,并用 Argilla 人工复核。
推荐理由:文章完整给出 LLM 辅助标注加小模型微调的流程与成本数据,读者可复用这套方法平衡精度与推理开销。
Hugging Face 发布开源开发者 EU AI Act 合规指南,说明该法案适用于欧盟内受影响的开源 AI 系统和模型。
推荐理由:面向开源开发者的指南,把 AI Act 的风险分级拆成文档、水印、opt-out 等可操作步骤,并给出 Hugging Face 现成工具。
Hugging Face 发布 2B 小型视觉语言模型 SmolVLM,含 Base、Synthetic 和 Instruct 三个版本,模型、数据集、训练配方均以 Apache 2.0 开源。
推荐理由:原文给出与同级 2B 模型的显存、token 编码和吞吐对比数据,可帮助读者评估端侧部署小 VLM 的实际成本。
Hugging Face Xet 团队正在重新设计 Hub 的上传与下载架构,在内容分发第一站插入内容寻址存储(CAS),采用“dumb reads and smart writes”理念在字节级处理文件。
Hugging Face 博客以迭代推导方式讲解位置编码设计,从整数编码、二进制编码到正弦编码,最终推导出 Llama 3.2 等现代 Transformer 采用的 RoPE。
推荐理由:文章把 RoPE 的设计过程拆成可跟随的迭代推导,从整数编码一步步走到旋转矩阵,适合想理解位置编码原理的读者。
OpenAI 发布了关于结合人员与 AI 推进红队测试的内容,介绍了将人工与 AI 方法结合用于红队测试的方向。
OpenAI 展示如何通过 GPT-4o 的视觉微调能力构建更智能的地图。文章介绍了利用 GPT-4o vision fine-tuning 提升地图相关视觉任务效果的方法。
Hugging Face 与跨组织项目 LLM-jp 联合推出 Open Japanese LLM Leaderboard,用于集中评测和比较日语大语言模型。
BAAI 推出 FlagEval Debate「Debate Arena」平台,让大模型两两辩论比拼推理与语言能力,目前支持中文、英文、阿拉伯语和韩语四语种。平台采用专家评审加用户投票的双评估体系,并允许参赛团队微调模型参数与对话策略。相比 LMSYS Chatbot Arena 等静态或用户投票式评测,它能缓解区分度不足、模型各自独立生成和投票偏好偏差等问题。
Hugging Face 的 Xet 团队正用内容定义分块(CDC)替代 Git LFS 的文件级存储,只传输和保存修改过的 chunk,以提升 Hub 上 30 PB 模型、数据集与空间的存储效率。
Hugging Face 详解 LayerSkip 提出的 self-speculative decoding:用同一模型的浅层生成草稿 token、深层做验证,兼得加速、内存节省与更低延迟。
Rox 全面押注 OpenAI,将其商业经验与深度 LLM 专长和 OpenAI 模型相结合。该方案旨在让每一位销售人员都达到前 1% 销售精英的水平。
Hugging Face 与 Atla 推出 Judge Arena 平台,让用户对两个 LLM 评判模型在同一测试样本上的打分与理由进行投票,结果以 Elo 分数汇入每小时更新的公开排行榜。
Mistral AI 宣布对旗下免费 AI 助手 le Chat 进行重大更新,新增带引用的联网搜索、Canvas 创作界面、Agents 自动化工作流,并以免费 beta 形式提供。
推荐理由:官方公布 le Chat 一批免费 beta 功能及与 ChatGPT 等竞品的功能对比表,读者可以据此判断它作为替代方案的位置。
Mistral 发布 Pixtral Large,一个基于 Mistral Large 2 的 124B 开源权重多模态模型,在 MathVista 达到 69.4%,DocVQA 与 ChartQA 上超过 GPT-4o 和 Gemini-1.5 Pro,LMSys Vision Leaderboard 上领先最近的开放权重模型近 50 ELO。
推荐理由:官方给出关键基准数字和开放下载渠道,读者可以据此判断该多模态模型在图像理解和文本能力上的定位。
OpenAI 在法国设立办公室,这是其欧洲大陆的首个办公地点。此次布局标志着 OpenAI 在欧洲的业务拓展进一步落地。
雅诗兰黛集团(The Estée Lauder Companies)使用 ChatGPT Enterprise 和自定义 GPT 分析消费者数据、挖掘洞察,加速美妆产品创新。OpenAI 展示了该企业级应用在数据驱动美容与创意领域的实际落地方式。
Hugging Face Hub 提供数据集托管与分享服务,可承载 TB 级数据集,Xet 团队正将单文件上限从 50 GB 提升至 500 GB。平台内置 Dataset Viewer(支持全文搜索和排序)、SQL Console,并兼容 Pandas、Spark、DuckDB 等第三方库,多数库一行代码即可加载或流式读取数据集。
Mistral 在 La Plateforme 上推出 Batch API,用于高吞吐量批量请求,价格比同步 API 调用低 50%。用户上传批处理文件,处理完成后下载输出文件即可,适用于情感分析、批量文档摘要与翻译、向量嵌入和数据标注等场景。该 API 支持平台上所有模型,每个工作区限 100 万个进行中请求,即将登陆云服务商伙伴平台。
Mistral AI 发布内容审核 API,与 Le Chat 的审核服务使用同一 API。该模型是基于 LLM 的分类器,可将文本输入分为 9 个类别,提供原始文本和对话内容两个端点,原生支持阿拉伯语、中文、英语、法语等 11 种语言。API 可帮助用户针对具体应用场景定制安全标准,政策类别涵盖不合格建议和 PII 等模型生成危害。
Hugging Face 发布 PyCharm 集成功能,开发者可在 IDE 内右键插入 HF 模型并自动获取示例代码。文章演示了用 microsoft/Phi-3.5-vision-instruct 十分钟内搭建图文对话应用,并介绍了悬停即显模型卡、本地模型缓存查看与清理等功能。该集成为 PyCharm Professional 专属,可用 PyCharm4HF 兑换 3 个月免费订阅。
Argilla 推出 2.4 新功能,无需写代码即可从 Hugging Face Hub 导入数据集并收集人工反馈。在 Argilla UI 中点击导入按钮即可开始,系统会根据数据集特征自动生成初始配置,可添加标签、评分、排序等问题;当前仅支持公开数据集,私有数据集支持尚未提供。该功能降低了领域专家参与数据集建设的门槛,部署推荐使用 Spaces 并默认启用 Hugging Face OAuth。
OpenAI 发布 ChatGPT search,可为用户提供快速、及时的答案,并附上相关网页来源链接。
推荐理由:OpenAI 官方宣布 ChatGPT 支持联网搜索并附来源链接,读者可据此了解其获取及时信息的新方式。
Promega 自上而下在全公司采用 ChatGPT,加快了制造、销售和营销环节的工作效率。
OpenAI 推出事实性基准 SimpleQA,用于衡量语言模型回答简短事实性问题的能力。
Decagon 与 OpenAI 合作,在大规模场景下提供高性能、完全自动化的客户支持服务。
Intel Labs 与 Hugging Face 推出 Universal Assisted Generation(UAG),通过双向 tokenizer 翻译让辅助生成不再要求目标模型与助手模型共享同一 tokenizer,可将任意 decoder 或 MoE 模型的推理加速 1.5x-2.0x 且几乎零开销。
推荐理由:原文解释了跨 tokenizer 助手模型的实现原理并给出多组加速数据,还提供 Transformers 4.46.0 的可用代码。
Digital Green 与 Hugging Face Expert Support 合作,为面向小农户的农业问答机器人 Farmer.chat 搭建了 LLM-as-a-judge 评测体系,覆盖提示词清晰度、问题类型、回答率和 RAG 准确性等指标,LLM 评分与约 360 题的人工评估高度相关。
Cohere For AI 发布 Aya Expanse 8B 和 32B 开源权重模型。在 Arena-Hard-Auto 23 语言成对对比中,Aya Expanse 32B 胜过 Gemma 2 27B。
OpenAI 发布论文,对连续时间一致性模型做了简化、稳定化和规模化,仅用两个采样步骤即可达到与领先扩散模型相当的样本质量。