资讯
H Company Releases NeoMME: A Family of 260M and 800M Single-Tower Multimodal Encoders That Drop the Vision Tower and Causal Decoder
📋总体概括
H公司发布NeoMME多模态编码器家族,包含260M和800M两个规格,采用单塔双向Transformer架构,直接处理多语言文本token与32×32原始图像块,摒弃传统视觉塔和因果解码器。预训练采用掩码离散扩散目标,配备稠密检索和后期交互双检索头。在ViDoRe v3文档检索基准上,260M模型取得0.523 nDCG@10,索引压缩比达255倍,单张L40S索引吞吐量51.3页/秒,但作者也承认在纯文本检索上仍有差距。
⚡关键信息
- ▸NeoMME提供260M和800M两个规格,用单个双向Transformer同时处理文本token和32×32原始图像块
- ▸架构上完全去掉预训练视觉塔和因果解码器,区别于ColPali式检索器
- ▸预训练目标为掩码离散扩散,检索端配备稠密检索和后期交互双头
- ▸260M模型在ViDoRe v3达到0.523 nDCG@10,索引压缩比255倍
- ▸单张L40S上索引吞吐量达51.3页/秒,但纯文本检索存在性能差距
🔥犀利点评
砍掉视觉塔和因果解码器,本质是用扩散式预训练把多模态检索做成了纯编码器生意——省参数、省显存、索引压缩255倍,这才是RAG时代检索器该有的样子。260M就能打,说明这个赛道拼的不是堆料。但作者自己承认文本检索有差距,等于宣告它是专职文档检索的偏科生,想一统多模态天下还为时过早。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 marktechpost.com 阅读全文 →