Endex 如何用 OpenAI 的 o1 和 o3-mini 构建自主金融分析师
金融分析平台 Endex 使用 OpenAI 的推理模型 o1 和 o3-mini,构建自主金融分析师。该产品由 OpenAI 推理模型驱动,面向金融分析场景。
金融分析平台 Endex 使用 OpenAI 的推理模型 o1 和 o3-mini,构建自主金融分析师。该产品由 OpenAI 推理模型驱动,面向金融分析场景。
Adyen 与 Hugging Face 联合发布 DABstep(Data Agent Benchmark for Multi-step Reasoning),包含 450 多个源自 Adyen 真实工作负载的数据分析任务,用于评估 LLM 和 AI 智能体。
Hugging Face 在 OpenAI 发布 Deep Research 后发起 24 小时复现任务,开源智能体框架并在 GAIA 验证集取得 55.15%,高于此前开源框架 SoTA Magentic-One 的约 46%。
推荐理由:原文给出开源复现 Deep Research 的具体架构与 GAIA 得分对比,读者可迁移其 CodeAgent 方法到自己的智能体系统。
OpenAI 推出 deep research,一个用推理能力整合大量网络信息、完成多步研究任务的智能体。即日起面向 Pro 用户开放,Plus 和 Team 用户随后可用。
推荐理由:官方说明了 deep research 的能力定位和开放节奏,读者可以据此了解它面向的用户范围。
Hugging Face 为 smolagents 加入视觉支持,使视觉语言模型可原生用于智能体流程。图像可在 agent.run 启动时传入,也可通过 step_callbacks 在每步动态写入 ActionStep 的 observations_images。
推荐理由:官方详解视觉语言模型如何接入 smolagents 智能体流程,并给出可复用的截图回调和浏览器智能体完整代码。
OpenAI 宣布推出 Operator,原文链接为 https://openai.com/index/introducing-operator。材料正文抓取失败,仅标题可用,产品细节以原文为准。
Hugging Face 概述了 AI 智能体的定义,并分析了其伦理权衡。文章提出,智能体的风险随自主性水平上升:用户让渡的控制越多,安全、隐私等风险越大,并建议不要开发能编写和执行自身代码的完全自主智能体,而半自主智能体的收益可能大于风险。
Hugging Face 发布 smolagents,一个约几千行代码的极简智能体库,支持以代码形式编写动作的 CodeAgent,可通过 E2B 沙箱安全执行,并保留传统 JSON 调用的 ToolCallingAgent。
推荐理由:官方发布并给出代码示例与基准对比,读者可以了解用代码写动作的智能体库如何上手以及何时该用智能体。
Hugging Face 在 Google Cloud 两款 Xeon 实例上评测了 Agentic AI 的文本嵌入与文本生成两类负载。
Mistral AI 宣布对旗下免费 AI 助手 le Chat 进行重大更新,新增带引用的联网搜索、Canvas 创作界面、Agents 自动化工作流,并以免费 beta 形式提供。
推荐理由:官方公布 le Chat 一批免费 beta 功能及与 ChatGPT 等竞品的功能对比表,读者可以据此判断它作为替代方案的位置。
Digital Green 与 Hugging Face Expert Support 合作,为面向小农户的农业问答机器人 Farmer.chat 搭建了 LLM-as-a-judge 评测体系,覆盖提示词清晰度、问题类型、回答率和 RAG 准确性等指标,LLM 评分与约 360 题的人工评估高度相关。
OpenAI 推出 MLE-bench,一个用于衡量 AI 智能体在机器学习工程任务上表现的评测基准。该基准目前仅随发布消息公布,具体评测任务与结果尚未在文中给出。
AI 公司 Altera 使用 GPT-4o 构建智能体与人类协作的全新领域。原文未披露具体产品细节,仅说明 GPT-4o 是其实现这一协作方向的核心模型。
Hugging Face 在 HuggingChat 上发布 Community Tools 功能,允许把任意公开 Space 转成模型可直接调用的工具,并借此扩展图像理解、视频生成和文本转语音等多模态能力。
推荐理由:官方介绍了把任意 Space 转成 HuggingChat 工具的做法,覆盖创建、配置参数和打包进助手的完整流程,读者可以照着复用。
OpenAI 介绍 Upwork 如何将 AI 应用于实际业务,把团队成员、运营和产品开发结合起来。
Mistral 宣布在 La Plateforme 上开放对 Mistral Large 2 和 Codestral 等旗舰及专家模型的定制,支持 base prompt、few-shot prompting 或 fine-tuning,可使用自己的数据集。
Hugging Face 报告其基于 Transformers Agents 构建的 ReactCodeAgent 在 GAIA 基准上取得佳绩:验证集得分 44.2%,排名第一,领先第二名 4 分;测试集得分 33.3%,排名第二,超过 Microsoft Autogen 的提交,并在最难的 Level 3 题目上拿到最佳平均分。
Cubzh 和 Gigax 联合 Hugging Face 发布 NPC-Playground,一个可在浏览器直接体验的 3D 演示,玩家可与 LLM 驱动的 NPC 对话互动。
MavenAGI 推出一款基于 GPT-4 构建的 AI 客服智能体。Tripadvisor、Clickup 和 Rho 等公司已在使用该智能体,以节省时间并更好地服务客户。
Hugging Face 与 LangChain 联合发布合作伙伴包 langchain_huggingface,由双方共同维护,旨在让 LangChain 用户更快用上 Hugging Face 生态的新功能。
Hugging Face 发布 Transformers Agents 2.0,新增可基于过往观察迭代的 ReactCodeAgent 与 ReactJsonAgent,并支持社区智能体分享。
推荐理由:官方详解新 Agent 框架的设计原则与多智能体用例,并给出基准结果,开源模型表现可作选型参考。
Hugging Face 发布 JAT,一个基于 Transformer 的多用途智能体项目,包含 Gato 的开放复现:发布了覆盖 Atari、BabyAI、Meta-World、MuJoCo 等环境的大量专家 RL 智能体、首个通用智能体训练数据集 JAT dataset(含数十万条专家轨迹)以及可玩电子游戏、控制机器人、执行导航指令的 JAT 模型。
Mistral AI 发布对话助手 Le Chat,作为与 Mistral 各模型交互的产品入口,底层可用 Mistral Large、Mistral Small 或原型模型 Mistral Next。
推荐理由:官方宣布对话助手并说明可用的底层模型与企业版方向,读者可借此了解 Mistral 模型的实际产品入口。
Hugging Face 讲解 ReAct 智能体原理,并发布 ChatHuggingFace 封装让开源模型接入 LangChain。评测显示 Mixtral-8x7B 在含 HotpotQA、GSM8K、GAIA 子集的基准上超越 GPT-3.5,Zephyr-7b-beta 和 Llama2-70b 表现较差;团队建议针对函数调用微调 Mixtral 以冲击 GPT-4。
OpenAI 宣布用户现在可以创建 ChatGPT 的自定义版本(GPTs)。这类自定义版本可结合指令、额外知识以及任意技能组合。
推荐理由:官方宣布可在 ChatGPT 中创建结合指令、知识与技能的自定义 GPT,读者可据此了解这一新能力的构成方式。
Hugging Face 在 huggingface.js 下推出 Agents.js 库,让 LLM 可在浏览器或服务端通过 JavaScript 调用工具,通过 npm install @huggingface/agents 安装。
Hugging Face 的 AI 游戏开发系列第五篇用 ChatGPT 为一个 5 天开发周期内的农场游戏生成故事内容,流程包括生成故事摘要、多轮精炼、撰写并扩展游戏内物品描述。文章指出语言模型易复刻《星露谷物语》等既有故事、长内容质量漂移并陷入重复,且直接使用生成内容可能带来法律、伦理和商业风险,建议将其用于头脑风暴、人工撰写最终内容。
这是 Hugging Face「AI for Game Development」系列第 2 部分,讲如何用 ChatGPT 辅助游戏设计:作者让 ChatGPT 以专业游戏设计师身份给出农场游戏的关键功能建议(作物多样性、进度系统、动态环境、社交多人、故事主题),并在 5 天开发周期内对前两点做了 gray-box 实现。
OpenAI 使用 GPT-3 创建下一代 AI 驱动的角色。这一应用展示了 GPT-3 在生成式角色创作方面的能力,为 AI 驱动角色的发展提供了新方向。
OpenAI 发布 VPT(Video PreTraining)方法,利用大规模无标注人类 Minecraft 游玩视频加少量标注承包商数据训练神经网络。经微调后模型可制作钻石工具,该任务熟练人类通常需超过 20 分钟(约 24,000 个操作),模型使用键鼠原生人类接口,被视为迈向通用计算机使用智能体的一步。
推荐理由:原文介绍了用少量标注数据加大规模无标注视频预训练的思路,对理解视频数据训练智能体方法有参考价值。
OpenAI 发布 Neural MMO,一个面向强化学习智能体的大规模多智能体游戏环境。该平台支持大量数量可变的智能体在持久、开放式的任务中运行。研究表明,纳入更多智能体和物种能带来更好的探索、分化生态位形成以及更高的整体能力。
OpenAI 发布 CoinRun 训练环境,为智能体将经验迁移到新情境的能力提供量化指标,并已帮助厘清强化学习中一个长期存在的难题。CoinRun 的复杂度介于传统平台游戏(如 Sonic the Hedgehog)与更低难度环境之间,同时对最先进算法仍构成有价值的泛化挑战。
OpenAI 展示在模拟机器人摔跤任务中,meta-learning 智能体能快速学会击败更强的非 meta-learning 智能体,并能在物理故障发生时进行适应调整。
OpenAI 发布新研究,让 AI 智能体发展出自己的语言进行通信。这项研究展示了智能体在训练过程中自主形成交流方式的能力。
OpenAI 发布论文《Emergence of grounded compositional language in multi-agent populations》,研究多智能体群体中有根基的组合式语言如何涌现。正文抓取失败,仅标题可用,具体方法与结果以原文为准。
OpenAI 发布 Universe,一个用于测量和训练 AI 通用智能的软件平台。它覆盖全球的各类游戏、网站和其他应用程序,作为 AI 智能体的训练与评估环境。