Pollen Robotics 开源 pollen-vision:机器人零样本视觉模型统一接口
开源人形机器人 Reachy 的开发商 Pollen Robotics 发布开源库 pollen-vision,提供面向机器人的零样本视觉模型统一接口,无需训练即可开箱使用。
开源人形机器人 Reachy 的开发商 Pollen Robotics 发布开源库 pollen-vision,提供面向机器人的零样本视觉模型统一接口,无需训练即可开箱使用。
Hugging Face 发布开源数据集 WebSight,用于训练视觉语言模型将网页截图转换为 HTML 代码。其最新版 WebSight-v0.2 扩展至 200 万个样本,改用真实图像和 Tailwind CSS。基于该数据集微调的模型 Sightseer 可将截图转为可运行的 HTML,并能在生成代码中嵌入与原图相近的图像。
UCLA 研究者发布 ConTextual 基准,包含 506 条指令,覆盖时间读取、导航、信息图等 8 类富文本视觉场景,用于评估多模态模型对文字与图像的上下文联合推理能力,并附带排行榜。
Mistral 发布旗舰语言模型 Mistral Large,称其在常用基准上仅次于 GPT-4,可通过 la Plateforme 和 Azure 使用,支持 32K tokens 上下文、英法德西意多语言、function calling 和 JSON 输出。同时发布优化延迟与成本的 Mistral Small,性能超过 Mixtral 8x7B,并简化了端点产品线、新增多币种定价。
推荐理由:官方给出了 Mistral Large 的基准对比、多语言与 function calling 能力,读者可据此评估它在 API 可用模型中的位置。
Hugging Face 发布 AI 水印入门博客,讲解图像、文本和音频内容的加水印方法及优缺点。文中介绍生成时嵌入与生成后添加两大类方法、Nightshade 与 Glaze 等图像防滥用工具、基于红绿 token 的 LLM 文本水印,以及 AudioSeal 语音水印,并列出 Hub 上 IMATAG、Truepic 等相关工具,同时指出文本检测在文本较短或模型未知时可靠性有限。
OpenAI 在 DevDay 发布 GPT-4 Turbo,支持 128K 上下文且价格更低,同时推出 Assistants API。GPT-4 Turbo with Vision、DALL·E 3 API 等更多开发者产品一同公布。
推荐理由:官方一次性给出 128K 上下文、降价与多个 API 开放入口,读者可以据此评估是否迁移现有调用与工作流。
Hugging Face 发布教程,介绍如何 fork 并配置 AI Comic Factory,通过 Inference API 部署到自己的私有 Space,避免长时间排队。
OpenAI 发布 GPT-4V(ision) 系统卡,说明其图像输入能力及相关评估情况。抓取内容仅含标题,正文细节不可得。
OpenAI 官方宣布 ChatGPT 新增多模态能力,可以看图、听声音并进行语音对话。正文未能抓取,仅标题信息可用,具体功能细节以原文链接为准。
Hugging Face 推出 Object Detection Leaderboard,对 Hub 上的目标检测模型按指标排名。文章讲解了 IoU、AP、AR 等指标的计算方法,并指出评测中可能导致不同报告结果不一致的偏差与陷阱。开发者可据此在数百个开源模型中挑选最适合自身应用的目标检测模型。
Hugging Face 发布开源视觉语言模型 IDEFICS,是 DeepMind 未公开的 Flamingo 的开放复现,接受任意图像和文本序列输入并生成文本,在多个图像文本理解基准上与原闭源模型表现相当。
推荐理由:原文说明了 IDEFICS 基于 Flamingo 的复现路线、参数规模与完全公开数据的训练方式,适合关注开源多模态模型生态的读者。
Hugging Face 在 Habana Gaudi2 上对 866M 参数的视觉语言模型 BridgeTower Large 进行微调加速。基于 Optimum Habana v1.7,配合硬件加速数据加载,Gaudi2 微调速度达到 A100 的 2.5 倍、H100 的 1.4 倍,吞吐最高达 768.7 samples/s。这些数据加载优化技术同样适用于其他受数据加载瓶颈约束的视觉模型。
OpenAI 发文介绍 Be My Eyes 应用使用 GPT-4 改善视觉无障碍体验。正文仅给出核心信息,未提供更多细节。
冰岛正使用 OpenAI 的 GPT-4 来保护冰岛语。这一合作旨在让这门使用人数较少的语言在 AI 时代得以传承和延续。
OpenAI 发布 GPT-4,称其为扩大深度学习规模的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本;虽然许多真实场景下仍不及人类,但在多项专业和学术基准上表现出人类水平性能。
推荐理由:官方原文明确 GPT-4 接受图像和文本输入,并在多项专业与学术基准上达到人类水平表现,可据此了解其能力定位。
Kakao Brain 与 Hugging Face 发布开源图像文本数据集 COYO-700M,以及基于它训练的 ViT 和 ALIGN 模型,其中 ALIGN 为首个开源版本。
Hugging Face 博客复盘志愿者团队在 2023 年 2 月土耳其地震后开发 afetharita 应用的过程:用 easyocr 加微调 NER 模型从求助推文截图提取姓名、电话和地址,用 bert-base-turkish 系列微调文本分类模型识别庇护、食物、物流等需求,并将地址经地理编码 API 显示在地图上。
Hugging Face 发布教程,介绍 Salesforce Research 的 BLIP-2 模型已登陆 Transformers 库,并演示零样本图像描述、提示式图像描述、视觉问答和对话式提示四类用法。
推荐理由:文章拆解了 BLIP-2 的 Q-Former 架构和两阶段预训练方法,并给出在 Transformers 中跑通图生文、VQA 和对话提示的完整代码。
Hugging Face 撰文介绍视觉-语言(vision-language)联合模型,以 OpenAI 的 CLIP 等为代表,这类模型可处理图像与自然语言文本,擅长图像描述、视觉问答、文本引导图像生成等任务。
Hugging Face 过去一年在计算机视觉领域持续投入,Hub 上现已支持 8 个核心视觉任务、超过 3000 个模型和 100 多个数据集,每个任务至少提供 10 个模型检查点。
Hugging Face 官方博客发布教程,讲解如何用 Transformers 和 Datasets 构建图像相似度系统:用 nateraw/vit-base-beans checkpoint 提取图像嵌入向量,通过余弦相似度在 beans 数据集 100 个候选样本中检索与查询图最相似的 Top 5。
Hugging Face 发布教程,讲解如何用 🤗 transformers 运行零样本分割模型 CLIPSeg。
推荐理由:教程讲清了 CLIPSeg 的零样本分割原理、文本与图像两种提示用法及低分辨率局限,并给出在 Segments.ai 上精修标注的完整流程。
Hugging Face 发布 Document AI 长文教程,梳理 OCR、文档图像分类、版面分析、文档解析、表格提取和 DocVQA 六大用例及对应开源模型。文中给出关键基准数字,如 LayoutLMv3 在 RVL-CDIP 达 95% 准确率、DocVQA ANLS 83.37,并提醒 LayoutLMv2/v3 checkpoint 不可商用,附数据准备与建模建议。
Hugging Face 展示如何用 Optimum Graphcore 库在 Graphcore IPU 上微调视觉 Transformer(ViT)模型,示例为在 ImageNet-21k 预训练的 ViT 上微调 ChestX-ray14 胸部 X 光数据集。
这是一篇教程,讲解如何将上一篇文章中用 TensorFlow Serving 本地部署的 Vision Transformer (ViT) 模型,通过 Docker 容器化和 Kubernetes 集群扩展为可服务大量用户的部署。
Hugging Face 为 🤗 Datasets 库新增音频与图像数据集的文档,包括更新后的 Quickstart 和按模态划分的专属指南。Quickstart 提供 PyTorch 或 TensorFlow 的端到端加载与处理示例,并引入 to_tf_dataset 函数将数据集转换为 tf.data.Dataset。
Hugging Face 团队发布教程,讲解如何用 TensorFlow Serving 在本地部署 Transformers 中的 TensorFlow 视觉模型,示例为 google/vit-base-patch16-224 图像分类模型。
BigScience 项目发布开源多语言大模型 BLOOM,1760 亿参数,可生成 46 种自然语言和 13 种编程语言的文本。训练历时 117 天,在法国 Jean Zay 超算上完成,涉及 70 多国 250 多个机构的 1000 多名研究者。
推荐理由:大语言模型开源和透明训练的代表性案例,说明了开放协作如何让百亿级参数模型走向可研究、可复用。
OpenAI 发布 VPT(Video PreTraining)方法,利用大规模无标注人类 Minecraft 游玩视频加少量标注承包商数据训练神经网络。经微调后模型可制作钻石工具,该任务熟练人类通常需超过 20 分钟(约 24,000 个操作),模型使用键鼠原生人类接口,被视为迈向通用计算机使用智能体的一步。
推荐理由:原文介绍了用少量标注数据加大规模无标注视频预训练的思路,对理解视频数据训练智能体方法有参考价值。
Graphcore 与 Hugging Face 扩展开源库 Hugging Face Optimum,为 Graphcore IPU 优化的 Transformer 模型现已覆盖 NLP、语音和计算机视觉,共 10 个模型,附 IPU 配置文件和即用的预训练与微调权重。
Hugging Face 多模态学习小组发布了一份伦理章程,将伦理原则作为机器学习研究生命周期的核心,并由伦理落地、数据治理与个人隐私领域专家参与撰写。章程明确了希望防止的滥用场景,包括生成可识别个人身份的信息、针对性别的偏见、在医疗和法律等高风险领域的鲁莽使用等。团队同时承诺保持透明、开放可复现、公平和自我批判,并承认部分价值观之间可能存在冲突,需逐案权衡风险与收益。
Hugging Face 发布教程,演示如何用自建人行道分割数据集 segments/sidewalk-semantic 微调 SegFormer(B0,仅约 14MB),面向披萨配送机器人的场景理解。
教程演示如何用 Hugging Face datasets 结合 sentence_transformers 和 faiss 构建图像搜索应用:用 ImageFolder 加载大英图书馆数字化图书中的装饰图像子集(10000 张)。
Hugging Face 将 Perceiver IO 加入 Transformers 库,这是首个能处理文本、图像、音频、视频、点云等多种模态及其组合的 Transformer 神经网络。该模型在 256 或 512 个 latent 变量上执行自注意力,使计算量与输入大小呈线性关系而非平方依赖。官方提供了预测光流和图像分类的 Spaces 示例及多个 notebook。
Hugging Face 社区周项目用 7 个 TPU v3-8、基于 JAX/Flax,以最多 10 亿句对训练出 20 个 Sentence Transformers 模型(含 Mini-LM、RoBERTa、DistilBERT、MPNet),在多个通用句子相似度评测上达到 SOTA,并发布 8 个专用数据集。
Hugging Face Flax/JAX Community Week 期间,一个团队用 RSICD 数据集(约 10,000 张卫星图像)及 UCM、Sydney 数据集微调了 OpenAI 的 CLIP 模型,因为卫星图像与日常图像差异较大。
OpenAI 发现在 CLIP 中存在对同一概念产生响应的神经元,无论该概念以字面、符号或概念形式呈现。这一现象可能解释了 CLIP 在对概念的出人意料的视觉表现形式进行分类时的准确性,也是理解 CLIP 及类似模型所学习的关联与偏差的重要一步。
推荐理由:原文指出了 CLIP 中多模态神经元的存在及其对理解模型学习关联与偏差的意义。
OpenAI 发布神经网络 CLIP,可从自然语言监督中高效学习视觉概念。只需提供待识别视觉类别名称,即可应用于任何视觉分类基准,类似 GPT-2 和 GPT-3 的零样本能力。
推荐理由:OpenAI 官方介绍 CLIP 如何用自然语言监督学习视觉概念,零样本思路可与 GPT 系列对照理解。
OpenAI 发布 Image GPT,将与语言模型相同架构的 Transformer 训练在像素序列上,可生成连贯的图像补全和样本。研究建立了生成样本质量与图像分类精度之间的相关性,其最佳生成模型在无监督设置下提取的特征可与顶级卷积网络竞争。
OpenAI 推出 Jukebox,一个能以原始音频形式生成多种流派和艺术家风格音乐、包括初阶演唱的神经网络。官方同时发布了模型权重和代码,并提供探索生成样本的工具。
推荐理由:原文说明了模型能以原始音频生成多风格歌曲并开源权重与代码,读者可自行探索生成样本。