摘要由 AI 生成
2026 年 9 月 6 日,H Company 发布了名为 NeoMME 的多模态编码器新系列。该系列包含参数规模分别为 2.6 亿和 8 亿的两种单塔模型架构,其核心设计去除了传统的视觉塔与因果解码器组件。NeoMME 采用单一 Transformer 层同时处理多语言文本及原始图像补丁,并基于离散掩码扩散技术进行预训练。在检索微调任务中,NeoMME-Retriever 版本于 ViDoRe v3 基准测试中分别取得 0.523 nDCG@10(260M 版)和 0.556 nDCG@10(800M 版)的成绩。该模型支持 16,384 个 token 的上下文长度,基于 Apache 2.0 协议开源,并在 Hugging Face Transformers 库中提供零日支持。性能方面,260M 版本…
关键实体KEY ENTITIES
ColPaliH CompanyHugging Face TransformersNeoMMEViDoRe v3
事件框架EVENT FRAME
产品发布
H Company
NeoMME
发布 NeoMME 系列多模态编码器
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- H Company1
- NeoMME1
- ColPali1
- ViDoRe v31
- Hugging Face Transformers1
全部报道(1)SOURCES
↗
H Company 发布了 NeoMME,一款由 260M 和 800M 参数组成的单塔多模态编码器家族,去除了视觉塔与因果解码器。该模型通过同一 Transformer 层处理多语言文本及原始图像补丁,采用离散掩码扩散预训练,检索微调版 NeoMME-Retriever 在 ViDoRe v3 上达到 0.523 nDCG@10(260M 版本)和 0.556(800M 版本)。NeoMME 支持 16,384 令牌上下文,基于 Apache 2.0 开源并在 Hugging Face Transformers 提供零日支持。在 ViDoRe v3 上,260M 模型性能接近 37.5B 参数的 ColQwen2.5-v0.2;在存储方面,通过分层分词池化可将每页索引从 1.5 MB 降至 39.0 kB。