Wener Notes

VLM Awesome

约 1 分钟阅读
标签:模型VLMMLLMVision资源精选

VLM / MLLM / Vision Awesome

视觉语言模型、多模态大语言模型和视觉任务资源索引。

VLM / MLLM

  • VLM - Vision Language Model。
  • MLLM - Multimodal Large Language Model。
  • 常见结构:视觉编码器 + Projector / Vision-Language Adapter + Language Model。
  • Projector 用于将视觉特征映射到语言模型表示空间,常见组件包括 Cross-Attention Module。
  • Bounding box 坐标格式必须按模型确认:
    • Qwen:(xmin, ymin, xmax, ymax),通常为 0-1 浮点数。
    • Gemini:(ymin, xmin, ymax, xmax),通常为 0-1000 整数。

视觉任务

  • Document OCR / Handwriting OCR。
  • Visual QA / Image QA。
  • Visual Reasoning。
  • Image Classification。
  • Document Understanding。
  • Video Understanding。
  • Object Detection / Object Counting。
  • Object Grounding:返回目标 Bounding Box 坐标。
  • Computer Agent:屏幕理解与交互操作。

Models 与资源

参考

关联信息

反向链接、本文链接的其他页面和外部资料。

反向链接

  • AI Model
    笔记 · VLM / MLLM / Vision

    AI Model Awesome 总索引 · LLM 与开放模型 · 图像生成 · 视频生成 · OCR · ASR / STT · TTS · VAD · 音乐生成 · VLM / MLLM / Vision · Agent 与 Coding

  • AI Model Awesome
    笔记 · VLM / MLLM / Vision

    按模型能力和使用场景组织的 AI 模型资源索引,保留模型架构、厂商、版本、推理资源、量化、微调和扩散模型历史资料。新增内容优先写入对应专题页面。 · LLM 与开放模型 · 图像生成 · 视频生成 · OCR 与文档理解 · ASR / STT

  • LLM Awesome
    笔记 · VLM / MLLM / Vision

    | Date | Model Series | Size | Context Window | Creator | Notes | · | 2026-04-07 | GLM 5.1 | 754B MoE | 200K | Zhipu AI | 大规模稀疏 MoE |

References

GitHub5 条
HuggingFace3 条
其他外链2 条
最近更新commit 42c1983Edit

On this page