VLX-Seek:让机器"看见"世界的细粒度感知视觉语言模型
VLX-Seek:让机器"看见"世界的细粒度感知视觉语言模型
https://github.com/om-ai-lab/VLX-Seek
VLX-Seek:让机器"看见"世界的细粒度感知视觉语言模型
一、引言
在人工智能飞速发展的今天,让机器不仅能"看懂"图像,还能精准"定位"世界,一直是视觉语言模型(VLM)领域的核心挑战。VLX-Seek 正是为了解决这一痛点而生的新一代细粒度感知视觉语言模型。它的核心价值在于:通过创新的区域引用机制,让模型在理解全局场景的同时,具备高精度、低延迟的目标定位与推理能力。作为 OmAI lab 的最新开源力作,VLX-Seek 采用宽松的 Apache 2.0 协议,自发布以来迅速在 GitHub 斩获 1.3k+ Star,成为了技术社区备受瞩目的焦点。
二、为什么需要VLX-Seek?
当前的现代 VLM 在理解全局场景、回答复杂问题时表现优异,但在面对细粒度感知任务时却常常显得力不从心。在具身视觉系统(如监控摄像头、无人机、服务机器人等)的实际应用中,系统不仅需要知道"画面里有什么",更需要精确定位"目标在哪里"、区分"同类目标的不同实例",甚至准确判断"目标是否存在"。
传统的 VLM 通常采用直接生成坐标的方式来实现目标定位。然而,这种范式存在显著的痛点:首先,坐标通常是一长串数字序列,当场景中存在多个目标时,模型的输出会急剧膨胀;其次,大语言模型在生成数字时容易出现格式错误(如小数点错位、括号不匹配),导致下游解析失败,结果直接无效;最后,逐字解码长数字序列极大地降低了推理效率,难以满足具身智能对实时性的严苛要求。VLX-Seek 的诞生,正是为了从根本上打破这一瓶颈。
三、核心技术创新:Region Reference
VLX-Seek 的核心突破在于,将传统的"生成坐标"定位任务,重新定义为"区域检索与引用"。这一范式转变带来了革命性的体验。
具体而言,其工作流程分为三步:首先,由区域提议网络生成候选区域;接着,将这些候选区域编码为可寻址的区域 Token(例如 , , );最后,大语言模型(LLM)不再费力地"算"坐标,而是通过选择、比较或引用这些区域 Token 来回答问题。
举个直观的例子:当用户询问"找到穿红衣服的人"时,传统模型可能需要输出 [120, 340, 250, 480] 这样的数字,而 VLX-Seek 只需输出 。这种设计带来了四大显著优势:
- 输出紧凑:用几个 Token 替代了冗长的数字序列,大幅减少了生成内容。
- 易于解析:离散的 Token 彻底消除了格式解析错误的问题。
- 与 LLM 行为对齐:将空间定位转化为类似自然语言的"指代"任务,更符合 LLM 的推理逻辑。
- 解码更快:在多目标场景下,Token 级别的输出让解码速度实现了质的飞跃。
四、技术架构详解
VLX-Seek 的精妙设计体现在其高度模块化的三大核心组件中:
- 区域提议(Region Proposal):采用解耦设计,将目标检测模块独立出来。这意味着开发者可以根据具体场景,灵活替换不同的检测器,在保证定位精度的同时,兼顾系统的扩展性。
- 混合细粒度区域编码器(HFRE):这是模型"看清细节"的秘密武器。它包含语义路径和细节路径,并结合 SimpleFP 多尺度特征,确保模型既能理解区域的宏观语义,又不会丢失微小的视觉细节。
- 基于 Token 的推理:在推理阶段,LLM 会同时接收全局图像 Token、文本 Token 以及编号区域 Token。通过这种多模态 Token 的融合,模型能够进行高效的语言条件检索,实现真正的"所见即所答"。
五、VLX-Seek 1.5 新特性
随着 1.5 版本的发布,VLX-Seek 迎来了全方位的升级:
- 更强的具身感知:针对性地扩展了无人机、监控、机器人等第一人称视角的训练数据,使其更懂"具身世界"。
- 升级视觉栈:引入了更强大的辅助视觉塔和 VLM 主干,提升了基础视觉特征提取能力。
- 更快推理:优化了区域提议管道,并增加了 Linear Attention 层,进一步降低了推理延迟。
- 减少幻觉检测:引入硬负样本拒绝训练和显式 None 格式,当画面中没有目标时,模型能果断回答"无",而不是强行编造坐标。
六、支持的任务
凭借强大的细粒度感知能力,VLX-Seek 能够胜任多种复杂的视觉任务:
| 任务类型 | 描述 |
|---|---|
| 开放词汇检测 | 识别并定位文本描述中的任意目标 |
| 指代表达理解 | 根据自然语言指代定位特定目标 |
| 区域 OCR | 识别并提取特定区域内的文字信息 |
| 区域描述 | 为指定的图像区域生成详细的文字描述 |
| 目标计数 | 准确统计画面中特定类别的目标数量 |
| 视觉区域推理 | 基于特定区域进行逻辑推理与问答 |
| 通用 VQA | 结合全局与局部信息的通用视觉问答 |
七、训练策略
为了打造如此强大的模型,VLX-Seek 采用了严谨的两阶段训练策略:
- 区域-语言对齐:首先让模型学会将视觉区域与语言 Token 建立映射关系。
- 感知指令微调:随后进行大规模的指令微调,激发模型的推理与定位能力。
在训练过程中,团队特别关注了两个关键问题:为了防止灾难性遗忘,训练中混入了大量通用 VLM 指令数据,确保模型在提升定位能力的同时不丢失全局理解力;为了防止幻觉定位,专门设计了负样本和拒绝样本训练,让模型学会在不确定或无目标时保持"诚实"。
八、开源生态与使用
VLX-Seek 提供了 0.6B、3B 和 10B 三种规格,当前已全面开源 10B 版本。开发者可以通过 Hugging Face (omlab/VLX-Seek-1.5-10B) 或 ModelScope 获取模型权重。在区域检测器方面,项目使用了开源的 WeDetect-Base-Uni 来替代内部的 OPN,进一步降低了使用门槛。
快速开始代码示例:
from vlx_seek import VLXSeekModel, VLXSeekProcessor
# 加载模型与处理器
model = VLXSeekModel.from_pretrained("omlab/VLX-Seek-1.5-10B")
processor = VLXSeekProcessor.from_pretrained("omlab/VLX-Seek-1.5-10B")
# 准备输入
inputs = processor(text="找到穿红衣服的人", images=image, return_tensors="pt")
# 推理生成
outputs = model.generate(**inputs)
print(processor.decode(outputs[0]))
# 预期输出: <obj2><obj5>
在技术传承上,VLX-Seek 吸收了 OmDet-Turbo、VLM-R1 以及 VLM-FO1 等前代项目的优秀基因,站在了巨人的肩膀上。
九、总结与展望
VLX-Seek 通过将空间定位转化为区域引用,成功解决了传统 VLM 在细粒度感知上的痛点,为视觉语言模型的发展提供了全新的范式。展望未来,随着具身智能的爆发和端侧部署需求的增加,VLX-Seek 这种紧凑、高效、抗幻觉的定位能力,必将在机器人导航、智能安防、自动驾驶等领域大放异彩,真正成为让机器"看见"并"理解"世界的利器。
“# 预期输出: <obj2><obj5>” 这个输出到底是什么东西?
<obj2><obj5> 是 VLX-Seek 模型输出的区域引用 Token,它是 VLX-Seek 最核心的创新——"区域引用"范式的直接体现。下面用通俗的方式解释一下:
它到底是什么?
VLX-Seek 在理解一张图片时,会先把图片切分成若干个候选区域(比如区域0、区域1、区域2……区域5……)。每个区域会被编码成一个特殊的 Token,格式就是 <obj0>、<obj1>、<obj2>……<obj5> 等。你可以把它们理解为模型给图片中每个候选区域贴的"编号标签"。
它是怎么工作的?
当用户输入指令"找到穿红衣服的人"时,模型的推理过程是这样的:
- 区域提议:模型先对图片做区域切分,生成一堆候选区域(比如 10 个候选框)
- 区域编码:每个候选区域被编码成一个
<obj*>Token - 区域选择:大语言模型"看"遍这些 Token,找到最符合"穿红衣服的人"描述的区域——假设是第 2 个和第 5 个候选区域
- 输出结果:模型只需要输出
<obj2><obj5>,告诉系统"答案就是区域 2 和区域 5 对应的图片区域"
它为什么比输出坐标好?
| 对比项 | 传统方式(输出坐标) | VLX-Seek(输出区域引用) |
|---|---|---|
| 输出内容 | [120.5, 340.2, 250.8, 480.1] |
<obj2> |
| 输出长度 | 一串长数字,多目标时更膨胀 | 几个短 Token |
| 解析难度 | 容易格式错误(小数点错位等) | 离散 Token,零解析错误 |
| 与 LLM 对齐 | 语言模型不擅长生成数字 | 本质是"指代",和 LLM 的推理方式一致 |
| 推理速度 | 逐字解码长数字序列,慢 | 只需输出几个 Token,快 |
总结一句话:
<obj2><obj5> 就是模型用"编号"来回答你的问题——"穿红衣服的人在区域 2 和区域 5 那里"。系统拿到这个编号后,直接去查区域 2 和区域 5 对应的图片坐标,就能画出准确的边界框了。这就是 VLX-Seek 把"生成坐标"变成"区域引用"的精妙之处。

浙公网安备 33010602011771号