资讯

H Company Releases NeoMME: A Family of 260M and 800M Single-Tower Multimodal Encoders That Drop the Vision Tower and Causal Decoder

marktechpost.com·2026/9/6 21:06:41🔗 原文

📋总体概括

H公司发布NeoMME多模态编码器家族,包含260M和800M两个规格,采用单塔双向Transformer架构,直接处理多语言文本token与32×32原始图像块,摒弃传统视觉塔和因果解码器。预训练采用掩码离散扩散目标,配备稠密检索和后期交互双检索头。在ViDoRe v3文档检索基准上,260M模型取得0.523 nDCG@10,索引压缩比达255倍,单张L40S索引吞吐量51.3页/秒,但作者也承认在纯文本检索上仍有差距。

关键信息

  • NeoMME提供260M和800M两个规格,用单个双向Transformer同时处理文本token和32×32原始图像块
  • 架构上完全去掉预训练视觉塔和因果解码器,区别于ColPali式检索器
  • 预训练目标为掩码离散扩散,检索端配备稠密检索和后期交互双头
  • 260M模型在ViDoRe v3达到0.523 nDCG@10,索引压缩比255倍
  • 单张L40S上索引吞吐量达51.3页/秒,但纯文本检索存在性能差距

🔥犀利点评

砍掉视觉塔和因果解码器,本质是用扩散式预训练把多模态检索做成了纯编码器生意——省参数、省显存、索引压缩255倍,这才是RAG时代检索器该有的样子。260M就能打,说明这个赛道拼的不是堆料。但作者自己承认文本检索有差距,等于宣告它是专职文档检索的偏科生,想一统多模态天下还为时过早。

本文由本站自动聚合,以下为原始来源:前往 marktechpost.com 阅读全文