摘要由 AI 生成
2026 年 9 月 9 日,蚂蚁集团发布其百灵系列首个原生多模态大模型 Ling-3.0-flash-VL。该模型总参数量为 124B,单次推理激活参数为 5.5B,基于 Ling-3.0-flash 拓展而来,原生支持图像、文本及视频输入,上下文窗口达 256K Token。模型引入了视觉反馈闭环机制,旨在支持医疗报告解读、代码生成及 GUI 自动化等任务。在 Artificial Analysis Intelligence Index v4.1.1 评估中,其较纯文本版本提升 4 分;在 Image-to-WebDev Arena 评测中得分高于 GPT-5.4。该模型采用任意分辨率视觉编码器与 VideoRoPE,语言主干沿用 42 层混合架构。目前,模型已在 Ling Studio 上线并提供免费体…
关键实体KEY ENTITIES
Hugging FaceInclusion AIModelScope蚂蚁集团
事件框架EVENT FRAME
产品发布
蚂蚁集团
Ling-3.0-flash-VL
开源首个原生多模态大模型
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- 蚂蚁集团1
- Inclusion AI1
- Hugging Face1
- ModelScope1
全部报道(1)SOURCES
↗
I
IT之家
zh
2026-09-09 09:23
蚂蚁集团发布开源百灵系列首个原生多模态大模型 Ling-3.0-flash-VL,总参数量 124B,单次推理激活 5.5B 参数。该模型基于 Ling-3.0-flash 拓展,原生支持图像、文本与视频输入,上下文窗口达 256K Token,引入视觉反馈闭环机制以支持医疗报告解读、代码生成及 GUI 自动化等任务。在 Artificial Analysis Intelligence Index v4.1.1 评估中较纯文本版本提升 4 分;在 Image-to-WebDev Arena 评测中得分高于 GPT-5.4。模型采用任意分辨率视觉编码器与 VideoRoPE,语言主干沿用 42 层混合架构,已在 Ling Studio 上线并提供免费体验,BF16 和 FP8 版本已开源。