如何用 Amazon Bedrock Knowledge Bases 以自然语言查询保险理赔
Amazon Bedrock Knowledge Bases 可为保险理赔文件构建对话式查询助手,通过 AgenticRetrieveStream API 将多部分问题拆解为子查询并多轮检索,直至证据充分后生成带引用的答案。
Amazon Bedrock Knowledge Bases 可为保险理赔文件构建对话式查询助手,通过 AgenticRetrieveStream API 将多部分问题拆解为子查询并多轮检索,直至证据充分后生成带引用的答案。
GitHub Podcast 最新一期逐条拆解五个常见 AI 观点:AI 生成代码仍需人工审查,但注意力应放在高风险处;Skills 与 MCP 解决不同问题,前者提供打包的专业知识、后者提供工具与数据接入标准,二者可组合使用;RAG 也没有死,好的检索能让模型更接近答案,与 Agent、skills、MAG 等可共存于同一工作流。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现符合奖励的 query fan-out 并编译为监督信号,绕过推理时的思考 token 开销。
Sentence Transformers v6.0 引入第四种模型类型 MultiVectorEncoder,支持 ColBERT 式后期交互检索及完整训练流程。
推荐理由:作者实测比较了六种训练起点和各训练超参,给出可在单张消费级 GPU 上数小时完成的完整多向量模型微调配方。
Hugging Face 团队详解 Papers with Code 混合搜索架构:PostgreSQL 全文检索加 pgvector 语义召回,经加权 RRF 融合,语义向量用 Qwen/Qwen3-Embedding-0.6B 生成 256 维 Matryoshka 截断向量。
Mistral 发布 Agentic Search,为模型提供 search、open、navigate、read、grep 五个工具,在现有索引上执行多步检索循环以处理复杂文档。
推荐理由:原文给出 Agentic Search 在 FinanceBench 和 OfficeQA Pro 上的具体数字,读者可以对照自己场景估算检索收益。
Hugging Face 发布教程介绍 Sentence Transformers v6.0 新增的第四种模型类型 MultiVectorEncoder,用于 ColBERT 式 late interaction 检索。
推荐理由:官方教程详解 Sentence Transformers v6.0 新增 MultiVectorEncoder 的用法,涵盖 MaxSim 原理、索引成本与视觉文档检索实践。
Mistral 发布 Mistral OCR 4,除文本外返回边界框、分类型块(标题、表格、公式、签名等)和逐页逐词置信度分数,支持 10 个语系下 170 种语言。
推荐理由:官方公布了能力细节、定价和基准方法论,还主动列出自动评测的打分缺陷,读者可据此判断在自己场景中怎么用。
Google 推出由 Agentic RAG 驱动的 Gemini Enterprise Agent Platform 版 Cross-Corpus Retrieval,采用多智能体架构(Orchestrator、Planner Agent、Query Rewriter、Search Fanout Agent 等)处理多数据源、多跳查询。
Mistral AI 发布开源框架 Search Toolkit 公共预览版,将数据摄取、检索与评估整合为单一框架,供企业构建生产级搜索管线。内置 BM25、稠密向量与混合检索,以及 recall、precision、MRR、NDCG 评估指标,模块共享统一配置接口;已在金融、制造、公共服务等行业验证,CMA CGM 配合 Voxtral 用于假新闻检测,音频管线端到端 15 秒内返回告警。
Hugging Face 的 Tom Aarsen 发布 ettin-reranker-v1 系列,含 17M 到 1B 六个 Sentence Transformers CrossEncoder 重排序模型,基于 Ettin ModernBERT 编码器,Apache 2.0 许可,支持最长 8192 token 上下文。
推荐理由:作者公开了六个模型、完整训练脚本和1.43亿条蒸馏数据,并给出与主流reranker的速度和精度对比,便于按规模选型或自行复现训练。
IBM 发布 Granite Embedding Multilingual R2 两款 Apache 2.0 多语言嵌入模型:97M 紧凑版在 MTEB Multilingual Retrieval 得 60.3。
推荐理由:原文给出完整基准数据、训练方法与框架集成示例,读者可按规模和场景直接选型。
Google Research 在 ICLR 论文中提出 ReasoningBank,一个从成功与失败经验中提炼结构化推理记忆的智能体框架,并开源了代码。它以检索、提取、整合的闭环运行,把失败案例转化为预防性经验;配合记忆感知的测试时扩展(MaTTS)进一步提效。
Hugging Face 博客讲解如何用 Sentence Transformers 训练和微调多模态嵌入与重排模型,以 Qwen/Qwen3-VL-Embedding-2B 在 Visual Document Retrieval 任务上微调为例。
推荐理由:作者用 Qwen3-VL 完整走通多模态嵌入微调流程,NDCG@10 从 0.888 提到 0.947,方法可直接迁移到自己的领域数据。
Hugging Face 发布 Sentence Transformers v5.4,用户可用同一套 API 对文本、图像、音频和视频进行嵌入编码与相关性重排。
推荐理由:官方教程给出 v5.4 多模态嵌入与重排的完整用法、代码示例和支持模型清单,读者可以直接照着搭建跨模态检索或 RAG 流程。
NVIDIA 在 Hugging Face 博客发布教程,用 6 条命令在单张 80GB GPU、不到一天内把 Llama-Nemotron-Embed-1B-v2 微调为领域专用嵌入模型,无需人工标注。
推荐理由:原文给出从文档到部署的完整六步命令与关键超参数,读者可照此在单卡上微调自己的领域嵌入模型。
Google Research 与 Cornell、Harvard 合作在 PNAS 发表论文,让 12 位高温超导专家出 67 道题并盲评 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和自建 RAG 系统的回答。
Hugging Face 发布 Retrieval Embedding Benchmark(RTEB)测试版,旨在可靠评估嵌入模型在真实应用中的检索准确性。它采用开放与私有数据集结合的混合策略来检测基准过拟合,覆盖 20 种语言和法律、医疗、代码、金融等企业领域,默认榜单指标为 NDCG@10,榜单已上线于 MTEB 排行榜的检索板块。
Google 发布开源嵌入模型 EmbeddingGemma,308M 参数、2K 上下文窗口,支持超过 100 种语言,量化后内存占用低于 200 MB,适合端侧 RAG 和 Agent 场景。
推荐理由:官方博客给出架构、基准和各框架用法,还附完整微调示例,读者可以据此判断如何把它接入现有检索流程。
Hugging Face 发布教程,介绍如何用 Model Context Protocol(MCP)让 AI 通过自然语言调用 arXiv、GitHub、Hugging Face 等研究工具,自动化文献发现的跨平台检索与交叉引用。
Mistral 发布首款代码专用嵌入模型 Codestral Embed,性能超越 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
Mistral 发布新的 Agents API,将语言模型与代码执行、网页搜索、图像生成、文档库和 MCP 工具等内置连接器结合,用于构建企业级智能体应用。
推荐理由:官方完整说明新 API 的内置连接器、有状态对话与多智能体编排,附 SimpleQA 对比数字和多个 cookbook,可直接评估落地方式。
Mistral 介绍用“LLM As A Judge”评估 RAG 系统的方法,即由一个 judge LLM 按 1-10、True/False 或定性等级为 generator LLM 的回答打分。
Hugging Face 发布 Sentence Transformers 训练和微调 reranker(Cross Encoder)模型的详细教程,覆盖数据集、损失函数、训练参数、评估器和 CrossEncoderTrainer 五个组件,并介绍 mine_hard_negatives 挖掘难负样本。
推荐理由:教程给出完整可复现的 reranker 微调配方和评测数据,读者可据此在自己领域训练出超过通用大模型的小型 reranker。
Mistral AI 发布 Mistral OCR 光学字符识别 API,输入图片和 PDF,输出图文交错内容,定位为多模态文档 RAG 系统的解析组件。
推荐理由:官方给出与 Azure OCR、Gemini、GPT-4o 的分项基准对比和定价细节,读者可以据此评估它是否适合替换现有文档解析链路。
这篇 Hugging Face 博客给出每天 10 亿级分类或嵌入推理的成本优化框架,用 Inference Endpoints、Infinity 和 Grafana k6 对三种用例实测。
推荐理由:原文给出可复现的成本与延迟优化框架和实测数字,读者可按自己的任务估算大规模分类和嵌入推理开销。
LlamaIndex 与 Hugging Face 发布多语言视觉文档检索嵌入模型 vdr-2b-multi-v1 及英文版 vdr-2b-v1,可直接对文档页截图编码检索,无需 OCR、数据抽取管线或分块。
Digital Green 与 Hugging Face Expert Support 合作,为面向小农户的农业问答机器人 Farmer.chat 搭建了 LLM-as-a-judge 评测体系,覆盖提示词清晰度、问题类型、回答率和 RAG 准确性等指标,LLM 评分与约 360 题的人工评估高度相关。
Hugging Face 团队发布教程,讲解如何用 distilabel 从 Argilla 2.0 技术文档合成三元组数据,微调 BAAI/bge-base-en-v1.5 嵌入模型(结合 TripletLoss 与 MatryoshkaLoss)。
Banque des Territoires(CDC 集团)、Polyconseil 与 Hugging Face 于今年 1 月启动合作,为支持法国学校生态改造计划 EduRénov 构建基于 RAG 的主权数据方案,第一阶段已完成。
总部位于多伦多的知识产权 AI 公司 XLSCOUT 联合 Hugging Face Expert Support Program 推出专利嵌入模型 ParaEmbed 2.0,通过在专家精选的多领域专利数据上微调,准确率较 2023 年 10 月发布的 ParaEmbed 1.0 提升 23%。
Hugging Face 宣布面向 Amazon SageMaker 的 Embedding Container 正式可用(GA),基于 Text Embedding Inference(TEI),支持在 SageMaker 上高效部署嵌入模型以构建 RAG 等生成式 AI 应用。
Hugging Face 发布教程,介绍如何使用 Sentence Transformers 库微调或从零训练嵌入模型,覆盖数据集、损失函数、训练参数、评估器和 Trainer 五个组件。
Hugging Face 与 LangChain 联合发布合作伙伴包 langchain_huggingface,由双方共同维护,旨在让 LangChain 用户更快用上 Hugging Face 生态的新功能。
Hugging Face 与 Intel 在 OPEA 框架下演示企业 RAG 应用构建:嵌入模型 BAAI/bge-base-en-v1.5 跑在 Xeon CPU(AMX-FP16 带来 2-3x 性能提升),LLM 经 TGI 服务跑在 Gaudi 2 加速器上,示例为 Intel/neural-chat-7b-v3-3。
Hugging Face 博客介绍如何用 Optimum Intel、Intel Neural Compressor 和 IPEX 将 BGE small/base/large 嵌入模型量化为 int8 并在 Intel Xeon 上加速。
Mistral AI 开放 La Plateforme 平台 Beta,任何人今日起可注册使用其 API。
推荐理由:官方首发公告给出各端点的模型、MT-Bench 与 MTEB 分数和定价权衡,读者可据此评估选型。
Hugging Face 展示如何通过 Inference Endpoints 与 Text Embeddings Inference(TEI)部署开源嵌入模型,用于 RAG 等检索增强场景。
Anyscale 团队将 Ray 集成到 Hugging Face Transformers 的 RAG(Retrieval Augmented Generation)模型的文档检索机制中,相比原 torch.distributed 实现将每次检索调用提速 2x,并提升分布式微调的可扩展性。