作者: Jakub Rusinowski · 最后更新: 2026年7月12日
最后更新:2026 年 5 月 —— 最新一代本地 LLM 不仅能生成文本,还能看图、处理文档,甚至理解音频。本指南讲解多模态 AI、哪些模型支持它,以及如何在本地运行视觉模型。
最后更新:2026 年 5 月 —— 最新一代本地 LLM 不仅能生成文本,还能看图、处理文档,甚至理解音频。本指南讲解多模态 AI、哪些模型支持它,以及如何在本地运行视觉模型。
多模态模型接受多种类型的输入:文本、图像、PDF、音频或视频。其输出通常仍是文本(描述、答案、分析),不过有些模型也能生成图像。
为什么重要: 你现在可以:
| 模态 | 说明 | 本地支持 |
|---|---|---|
| 文本 → 文本 | 经典 LLM 推理 | ✅ 通用 |
| 图像 → 文本 | 描述、分析、对图像做 OCR | ✅ 许多模型 |
| PDF → 文本 | 提取并推理文档内容 | ✅ 通过图像分块 |
| 音频 → 文本 | 转录 + 理解 | ⚠️ 有限(Whisper + LLM 流程) |
| 视频 → 文本 | 逐帧分析 | ⚠️ 实验性 |
| 文本 → 图像 | 根据提示生成图像 | ✅ 独立模型(Stable Diffusion) |
Meta 的视觉模型与 Ollama 无缝集成:
# Pull and run Llama 3.2 Vision
ollama run llama3.2-vision:11b
# Then send an image in your chat
# (Works in Open WebUI with drag-and-drop)
谷歌的 Gemma 3 系列在所有规格上原生支持多模态:
ollama run gemma3:12b # Vision enabled by default
ollama run gemma3:27b # Best quality for complex images
阿里巴巴的 Qwen VL 系列擅长文档与图表理解:
ollama run qwen2.5-vl:7b
视觉模型比同规格的纯文本模型占用更多显存,因为它们包含一个视觉编码器(通常是 CLIP 或 SigLIP):
| 模型 | 显存(Q4_K_M) | 显存(Q8) | 备注 |
|---|---|---|---|
| Gemma 3 4B Vision | ~4 GB | ~7 GB | 最快、入门级 |
| Llama 3.2 Vision 11B | ~7.5 GB | ~12 GB | 出色的全能选手 |
| Gemma 3 12B Vision | ~8.5 GB | ~14 GB | 最佳中端 |
| Qwen 2.5-VL 7B | ~5.5 GB | ~8 GB | 最适合文档 |
| Gemma 3 27B Vision | ~17 GB | ~28 GB | 接近 GPT-4V 质量 |
| Qwen 2.5-VL 72B | ~42 GB | — | 需要多 GPU |
Open WebUI 为视觉任务提供了最简单的界面:
# Start Open WebUI with Ollama backend
docker run -d -p 3000:8080 \
--add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data \
--name open-webui \
ghcr.io/open-webui/open-webui:main
# Access at http://localhost:3000
# Drag and drop images directly into the chat
通过 API 以编程方式使用:
import ollama
import base64
# Load and encode image
with open("screenshot.png", "rb") as f:
image_data = base64.b64encode(f.read()).decode()
response = ollama.chat(
model="llama3.2-vision:11b",
messages=[{
"role": "user",
"content": "What error is shown in this screenshot?",
"images": [image_data]
}]
)
print(response["message"]["content"])
丢入一张错误信息的截图,然后问:"是什么导致了这个错误,我该如何修复?"
上传一份 PDF 扫描件:"提取这张发票中的所有日期和金额。"
上传一张业务图表:"描述这张营收图表所显示的趋势。"
上传一张网站截图:"你会为这个表单提出哪些 UX 改进建议?"
在正确的 HIPAA 部署下:"描述你在这张 X 光片中观察到的情况"——用于研究辅助,而非诊断。
对于音频理解,将 Whisper(转录)与任意 LLM 结合:
# Install Whisper
pip install openai-whisper
# Transcribe audio
whisper meeting_recording.mp3 --model medium --output_format txt
# Then pipe transcript to Ollama
cat meeting_recording.txt | ollama run llama3.1 "Summarize the key decisions from this meeting transcript:"
num_gpu 设为最大本地视觉模型能读取图像中的文字(OCR)吗? 能——Qwen 2.5-VL 7B 在 OCR 上尤其强。它能准确读取菜单、收据、白板和文档中的文字。
本地视觉质量与 GPT-4V 相比如何? 在大多数任务上,Gemma 3 27B 和 Qwen 2.5-VL 72B 可与 GPT-4V 竞争。对于简单的图像描述,即便是 7–12B 模型通常也已足够。
我能在本地运行视频分析吗? 目前还不高效。大多数工具把视频当作单独的帧来处理,速度慢。以每秒 1 帧做逐帧分析是可行的,但对长视频不切实际。
视觉模型能处理 PDF 文件吗? 间接可以——你需要先把 PDF 页面转换为图像,再发送给视觉模型。pdf2image 这类工具可自动完成。