Autor: Jakub Rusinowski · Ostatnia aktualizacja: 12 lipca 2026
Ostatnia aktualizacja: maj 2026 — Najnowsza generacja lokalnych modeli LLM potrafi widzieć obrazy, przetwarzać dokumenty, a nawet rozumieć dźwięk — nie tylko generować tekst. Ten przewodnik wyjaśnia m
Ostatnia aktualizacja: maj 2026 — Najnowsza generacja lokalnych modeli LLM potrafi widzieć obrazy, przetwarzać dokumenty, a nawet rozumieć dźwięk — nie tylko generować tekst. Ten przewodnik wyjaśnia multimodalną AI, które modele ją obsługują i jak uruchamiać modele wizyjne lokalnie.
Model multimodalny przyjmuje wiele rodzajów danych wejściowych: tekst, obrazy, pliki PDF, dźwięk lub wideo. Wynikiem zwykle wciąż jest tekst (opisy, odpowiedzi, analizy), choć niektóre modele potrafią też generować obrazy.
Dlaczego to ważne: możesz teraz:
| Modalność | Opis | Wsparcie lokalne |
|---|---|---|
| Tekst → Tekst | Klasyczne wnioskowanie LLM | ✅ Uniwersalne |
| Obraz → Tekst | Opis, analiza, OCR obrazów | ✅ Wiele modeli |
| PDF → Tekst | Ekstrakcja i wnioskowanie nad treścią dokumentu | ✅ Przez dzielenie na obrazy |
| Audio → Tekst | Transkrypcja + rozumienie | ⚠️ Ograniczone (pipeline Whisper + LLM) |
| Wideo → Tekst | Analiza klatka po klatce | ⚠️ Eksperymentalne |
| Tekst → Obraz | Generowanie obrazów z promptów | ✅ Osobne modele (Stable Diffusion) |
Model wizyjny Meta integruje się bezproblemowo z Ollama:
# Pull and run Llama 3.2 Vision
ollama run llama3.2-vision:11b
# Then send an image in your chat
# (Works in Open WebUI with drag-and-drop)
Rodzina Gemma 3 od Google jest natywnie multimodalna we wszystkich rozmiarach:
ollama run gemma3:12b # Vision enabled by default
ollama run gemma3:27b # Best quality for complex images
Seria Qwen VL od Alibaby wyróżnia się w rozumieniu dokumentów i wykresów:
ollama run qwen2.5-vl:7b
Modele wizyjne ważą więcej, niż sugeruje liczba parametrów, a najbardziej daje to o sobie znać na telefonie: planowanie miejsca i pobierania na iOS opisuje, ile naprawdę kosztuje tam wielogigabajtowy model.
Modele wizyjne zużywają więcej VRAM niż tylko-tekstowe o tym samym rozmiarze, ponieważ zawierają enkoder wizyjny (zwykle CLIP lub SigLIP):
| Model | VRAM (Q4_K_M) | VRAM (Q8) | Uwagi |
|---|---|---|---|
| Gemma 3 4B Vision | ~4 GB | ~7 GB | Najszybszy, poziom podstawowy |
| Llama 3.2 Vision 11B | ~7,5 GB | ~12 GB | Dobry uniwersalny |
| Gemma 3 12B Vision | ~8,5 GB | ~14 GB | Najlepszy średni poziom |
| Qwen 2.5-VL 7B | ~5,5 GB | ~8 GB | Najlepszy do dokumentów |
| Gemma 3 27B Vision | ~17 GB | ~28 GB | Jakość bliska GPT-4V |
| Qwen 2.5-VL 72B | ~42 GB | — | Wymagane multi-GPU |
Open WebUI zapewnia najłatwiejszy interfejs do zadań wizyjnych:
# Start Open WebUI with Ollama backend
docker run -d -p 3000:8080 \
--add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data \
--name open-webui \
ghcr.io/open-webui/open-webui:main
# Access at http://localhost:3000
# Drag and drop images directly into the chat
Do użycia programowego przez API:
import ollama
import base64
# Load and encode image
with open("screenshot.png", "rb") as f:
image_data = base64.b64encode(f.read()).decode()
response = ollama.chat(
model="llama3.2-vision:11b",
messages=[{
"role": "user",
"content": "What error is shown in this screenshot?",
"images": [image_data]
}]
)
print(response["message"]["content"])
Wrzuć zrzut ekranu z komunikatem błędu i zapytaj: „Co powoduje ten błąd i jak go naprawić?”
Prześlij skan PDF: „Wyodrębnij wszystkie daty i kwoty z tej faktury.”
Prześlij wykres biznesowy: „Opisz trend widoczny na tym wykresie przychodów.”
Prześlij zrzut ekranu strony: „Jakie usprawnienia UX zasugerowałbyś dla tego formularza?”
Przy odpowiedniej konfiguracji HIPAA: „Opisz, co widzisz na tym zdjęciu rentgenowskim” — jako pomoc badawcza, nie diagnoza.
Do rozumienia dźwięku połącz Whisper (transkrypcja) z dowolnym LLM:
# Install Whisper
pip install openai-whisper
# Transcribe audio
whisper meeting_recording.mp3 --model medium --output_format txt
# Then pipe transcript to Ollama
cat meeting_recording.txt | ollama run llama3.1 "Summarize the key decisions from this meeting transcript:"
num_gpu jest ustawione na maksimum w Ollama dla modeli wizyjnychCzy lokalne modele wizyjne potrafią odczytać tekst z obrazów (OCR)? Tak — Qwen 2.5-VL 7B jest szczególnie silny w OCR. Potrafi dokładnie odczytać tekst z menu, paragonów, tablic i dokumentów.
Jak jakość lokalnej wizji wypada w porównaniu z GPT-4V? Gemma 3 27B i Qwen 2.5-VL 72B są konkurencyjne wobec GPT-4V w większości zadań. Do prostego opisu obrazu często wystarczą nawet modele 7–12B.
Czy mogę uruchomić analizę wideo lokalnie? Jeszcze nie wydajnie. Większość narzędzi przetwarza wideo jako pojedyncze klatki, co jest wolne. Analiza klatka po klatce przy 1 klatce/sekundę jest możliwa, ale niepraktyczna dla długich filmów.
Czy modele wizyjne działają z plikami PDF? Pośrednio — najpierw musisz przekonwertować strony PDF na obrazy, a następnie wysłać je do modelu wizyjnego. Narzędzia takie jak pdf2image automatyzują to.