Endex 如何用 OpenAI 的 o1 和 o3-mini 构建自主金融分析师
金融分析平台 Endex 使用 OpenAI 的推理模型 o1 和 o3-mini,构建自主金融分析师。该产品由 OpenAI 推理模型驱动,面向金融分析场景。
金融分析平台 Endex 使用 OpenAI 的推理模型 o1 和 o3-mini,构建自主金融分析师。该产品由 OpenAI 推理模型驱动,面向金融分析场景。
印度科学理工学院(IISc)与 ARTPARK 和 Hugging Face 合作,将开源多模态多语言数据集 Vaani 开放给全球开发者。
OpenAI 在发布 deep research 前公布系统卡,说明相关安全工作。内容包括外部红队测试、依据 Preparedness Framework 开展的前沿风险评估,以及针对关键风险领域构建的缓解措施概览。
Hugging Face 发布 FastRTC,一个面向 Python 的实时通信库,用于简化实时音视频 AI 应用开发。库内自动处理语音检测与轮次切换,自带 WebRTC Gradio UI,支持 WebRTC 和 WebSocket,可将 Stream 挂载到任意 FastAPI 应用。
推荐理由:官方发布 Python 实时通信库,内置语音检测、Gradio UI 和免费电话接入,作者还演示了接入 LLM 的完整语音对话代码。
Diffusers 团队推出实验性 Remote VAE 功能,通过 huggingface-inference-toolkit 自定义 handler 将 VAE 解码委托给远程端点,以缓解高分辨率图像和视频生成时消费级 GPU 显存不足、offload 延迟和 tiling 画质损失问题。
Google 发布 SigLIP 2 多语言视觉语言编码器家族,在 sigmoid 损失之上加入解码器、Global-Local 损失和 Masked Prediction 等训练目标。新模型在零样本分类、图文检索和为 VLM 提取视觉表征的迁移能力上全面超过旧版 SigLIP,并新增动态分辨率的 naflex 变体和 1B 参数的 Giant 系列,模型已在 Hugging Face 开放。
Uber 客户关怀部门 AI 与产品负责人 Jai Malkani 分享了公司如何利用 AI 提升按需服务体验。
Hugging Face 发布 SmolVLM2 系列,包含 2.2B、500M 和 256M 三种参数规模,主打让视频理解在手机到服务器等设备上运行。
推荐理由:官方发布三档小尺寸视频理解模型并给出端侧运行方案,读者可以据此评估轻量多模态模型在自己的设备上的可行性。
Google 发布 PaliGemma 2 mix 系列,这是在 PaliGemma 2 预训练模型基础上针对多种视觉语言任务微调的指令模型,基于 SigLIP 和 Gemma 2,提供 3B、10B、28B 三种规模。
OpenAI 推出 SWE-Lancer 基准,将真实自由职业软件工程任务转化为 LLM 评测,总价值 100 万美元,考察前沿模型能否赚取这笔报酬。该基准用真实 Upwork 工程任务衡量模型的实际编程能力。
Hugging Face Hub 新增 Hyperbolic、Nebius AI Studio 和 Novita 三家 serverless 推理提供商,支持 DeepSeek-R1、FLUX.1 等模型,并集成到 Python 和 JS 客户端 SDK。
Mistral AI 发布 24B 参数区域语言模型 Mistral Saba,基于中东和南亚数据训练,官方称其表现优于 5 倍以上规模的模型且更快更省成本。模型支持阿拉伯语及多种印度语系语言(泰米尔语尤其强),可通过 API 使用,也可像 Mistral Small 3 一样在单 GPU 上本地部署,速度超过 150 tokens per second。
OpenAI 与 Guardian Media Group 宣布达成内容合作,将 Guardian 新闻内容引入 ChatGPT。此次合作让 ChatGPT 用户能够获取 Guardian 的新闻报道。
Hugging Face 用 Math-Verify 重新评测了 Open LLM Leaderboard 上全部 3751 个模型,修复旧评测器的格式、SymPy 解析和比较缺陷。模型平均多解对 61 题、整体提升 4.66 分,Qwen 分数翻倍以上、DeepSeek 接近三倍,MATH-Hard 榜首被 Nvidia AceMath 占据。
推荐理由:原文给出了旧评测器三类具体缺陷与修复后的排名变化,读者可以借此判断自己模型的数学评测结果是否被低估。
Fireworks.ai 现已成为 Hugging Face Hub 支持的推理提供商,可在模型页面及 HF 生态中提供高速 serverless 推理。
OpenAI 与 Fanatics Betting and Gaming 首席财务官 Andrea Ellis 对谈,介绍该公司如何使用 AI 聚焦大局。内容围绕这家博彩游戏公司在财务等业务中应用 AI 的实践展开。
OpenAI 发布与 Wayfair 首席技术官 Fiona Tan 的对话,介绍该公司如何用 AI 塑造零售业的未来。
Rogo 利用 OpenAI o1 扩展 AI 驱动的金融研究。该公司的分析工作依托 o1 的推理能力,在金融领域规模化落地。
这篇 Hugging Face 博客给出每天 10 亿级分类或嵌入推理的成本优化框架,用 Inference Endpoints、Infinity 和 Grafana k6 对三种用例实测。
推荐理由:原文给出可复现的成本与延迟优化框架和实测数字,读者可按自己的任务估算大规模分类和嵌入推理开销。
Hugging Face 作者 hlky 和 Sayak 开源了一套视频生成数据集构建工具,覆盖获取、过滤和处理三阶段,使用 yt-dlp 下载、LAION-5B-WatermarkDetection 检测水印、OpenCV 评估运动,并用 Florence-2 生成多种字幕。
Hugging Face Xet 团队开源 xet-core 和 hf_xet,将内容定义分块(CDC)引入 Hub,在部分场景将上传下载速度提升 2-3x。
Hugging Face Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,在 512 张 H100 上用 DeepSeek R1 为 40 万道题生成 80 万条推理轨迹,经 Math Verify 和 Llama3.3-70B-Instruct 过滤后保留 22 万条正确轨迹。
推荐理由:原文详述数学推理数据集的构建方法、过滤策略与消融结果,也覆盖社区在小样本微调和 CoT 长度控制上的进展。
OpenAI 与 Schibsted Media Group 宣布达成内容合作协议,将 Guardian 的新闻及档案内容引入 ChatGPT。
Hugging Face 联合 2A2I、TII 推出的 Open Arabic LLM Leaderboard 即将升级为第二版。第一版上线不到 7 个月吸引超 46,000 访客、提交超 700 个模型(1B 至 70B+ 参数),覆盖 180 多个组织;其中 70% 以上为 chat 和微调模型,超 50% 的模型小于 7B。新版将针对社区反馈,加强阿拉伯语特定任务评测与基准透明度。
OpenAI 在超级碗期间播出了公司的首支电视广告,意在激发人们对 AI 的好奇心。广告传达的理念是:AI 能像历史上的各种工具一样,为人们开辟新的可能、带来更多成就感并提升生产力。
Mistral AI 发布全新 le Chat,定位覆盖生活与工作的 AI 助手,现已上线 iOS、Android 和 chat.mistral.ai。
推荐理由:官方公告列出了 le Chat 的功能变化、移动端入口和三档服务定价,读者可以据此评估它在个人与工作场景中的可用性。
OpenAI 宣布在欧洲推出数据驻留功能,让客户的最终内容可以存储在欧盟境内。该功能建立在 OpenAI 面向全球客户的企业级数据隐私、安全与合规项目之上。
OpenAI 与加州州立大学系统(CSU)合作,向 50 万名学生和教职工部署 ChatGPT。官方称这是迄今为止最大规模的 ChatGPT 部署,旨在扩大 AI 在教育中的应用并帮助美国培养 AI 就绪的劳动力。
OpenAI 分享用 ChatGPT 寻找美甲设计灵感的方法:用户可以生成美甲图案创意,作为美甲参考。
一位钓鱼爱好者分享了如何用 ChatGPT 辅助捕捞大比目鱼:借助 AI 获取钓鱼地点选择、装备准备和捕捞技巧方面的建议,并在实践中取得成效。
Hugging Face 宣布将 Physical Intelligence 开发的 π0 和 π0-FAST 视觉-语言-动作(VLA)机器人基础模型移植到 LeRobot 仓库。
OpenAI 展示如何基于 ChatGPT 构建定制数学辅导应用。文章介绍了 ChatGPT 在个性化一对一教学场景中的使用方式与搭建思路。
Adyen 与 Hugging Face 联合发布 DABstep(Data Agent Benchmark for Multi-step Reasoning),包含 450 多个源自 Adyen 真实工作负载的数据分析任务,用于评估 LLM 和 AI 智能体。
Hugging Face 在 OpenAI 发布 Deep Research 后发起 24 小时复现任务,开源智能体框架并在 GAIA 验证集取得 55.15%,高于此前开源框架 SoTA Magentic-One 的约 46%。
推荐理由:原文给出开源复现 Deep Research 的具体架构与 GAIA 得分对比,读者可迁移其 CodeAgent 方法到自己的智能体系统。
OpenAI deep research 正被 Bain & Company 用于理解复杂的行业趋势。该工具帮助咨询团队更高效地梳理和分析跨领域的产业动态,为行业趋势研究提供支持。
OpenAI 推出 deep research,一个用推理能力整合大量网络信息、完成多步研究任务的智能体。即日起面向 Pro 用户开放,Plus 和 Team 用户随后可用。
推荐理由:官方说明了 deep research 的能力定位和开放节奏,读者可以据此了解它面向的用户范围。
Hugging Face 发布 Open-R1 项目启动一周后的进展更新,目标复现 DeepSeek-R1 缺失的训练管线与合成数据。
推荐理由:官方一周进展报告给出可复现的评测数字、GRPO 训练管线与大规模推理生成的具体配置,读者可以直接沿用其工程做法。
OpenAI 封禁了在加纳 2024 年总统大选期间滥用 AI 的账号。这些账号利用 AI 生成文章、帖子和虚假互动,开展隐蔽的影响力操作。
OpenAI 封禁了一批疑似来自中国的账号,这些账号利用 AI 生成英文社交媒体帖子和西班牙语文章,从事影响活动。
OpenAI 发起 "Peer Review" 行动,封禁了疑似源自中国、利用 AI 起草监控工具推介材料、分析文档和调试代码的账号。该通报由 OpenAI 官方发布,属于对其平台恶意使用行为的处置披露。