Hugging Face 引入了 Idefics2,一个 8B 开源视觉语言模型

Hugging Face 引入了 Idefics2,一个 8B 开源视觉语言模型

Hugging Face 于 2023 年首次发布了其 Idefics 视觉语言模型,该模型使用 DeepMind 最初开发的技术提供支持。如今,Idefics 正在接受升级,具有更小的参数大小、开放许可证和改进的光学字符识别 (OCR) 功能。Idefics2 现已在 Hugging Face 上推出。

Idefics 是 Image-aware Decorder Enhanced à la Flamingo with Interleaved Cross-attentionS 的缩写,是一种可以响应文本和图像提示的通用多模态模型。虽然其前身的参数大小为 800 亿,但 Idefics2 的参数大小仅为 80 亿的十分之一,可与 DeepSeek-VL 和 LLaVA-NeXT-Mistral-7B 相媲美。

在其核心功能中,Idefics2 承诺在高达 980 x 980 像素的原始分辨率和原始纵横比下提供更好的图像处理。图像将不再需要调整大小以适应固定大小的平方比,这在计算机视觉中传统上是完成的。

通过转录图像或文档中的文本生成的数据集成,增强了 OCR 功能。Hugging Face的团队还提高了Idefics回答图表、数字和文档问题的能力。

最后,该模型的架构得到了简化,摆脱了 Idefics1 的门控交叉注意力。“图像被馈送到视觉编码器,然后是学习的感知器池化和[多层感知器]模态投影,”Hugging Face在一篇博客文章中说。 “然后将池化的序列与文本嵌入连接起来,以获得图像和文本的(交错)序列。

Hugging Face 使用公开可用的数据集(特别是 Mistral-7B-v0.1 和 siglip-so400m-patch14-384)来训练 Idefics2。此外,还利用了 Web 文档、图像标题对、OCR 数据、渲染文本和图像到代码数据。

它的发布是随着人工智能热潮的持续而推出的许多多模态模型的一部分,包括 Reka 的新 Core 模型、xAI 的 Grok-1.5V 和谷歌的 Imagen 2。

椰有料原创,作者:小椰子啊,转载请注明出处:http://www.studioyz.com/5935.html

0

扫一扫,分享到微信

猜你喜欢

文章评论

电子邮件地址不会被公开。 必填项已用*标注

后发表评论

上一篇

Telesign 的 Verify API 与 AI 和 ML 相结合,以确保全渠道增长

下一篇

MongoDB 与 AWS、Google 和 Microsoft 等 AI 初创公司和云提供商的合作伙伴关系正在为开发人员生成式 AI 创新铺平道路

微信公众号

微信公众号