Rodzina Qwen obejmuje modele, które można uruchomić na własnym sprzęcie: do odpowiadania na pytania o dokumenty, edycji kodu, odczytywania skanów czy klasyfikacji danych. Każde z tych zadań stawia inne wymagania modelowi i komputerowi.
Zacznij od jednego zadania, kilku typowych przykładów i sprzętu, którego zamierzasz używać. Następnie wybierz wersję modelu, którą możesz sprawdzić w tych warunkach. Poniższe przykłady pokazują wybrane części rodziny Qwen. Szczegóły znajdziesz w dokumentacji poszczególnych modeli.
Dobierz model do danych wejściowych
Pierwsze wydanie Qwen3 zawierało modele gęste, czyli dense, o rozmiarach od 0,6 do 32 miliardów parametrów, a także modele typu mixture-of-experts. Warianty 4B i 8B można rozważyć do pierwszych prób lokalnych przy ograniczonej pamięci. To wydanie wprowadziło również tryby thinking i non-thinking, w których model generuje odpowiednio rozumowanie przed odpowiedzią lub samą odpowiedź. W porównaniach uwzględnij wybrany tryb. Opis wydania Qwen3.
Do pracy nad oprogramowaniem warto sprawdzić model przeznaczony do programowania. Qwen3-Coder-30B-A3B-Instruct powstał z myślą o kodzie i korzystaniu z narzędzi. Zgodnie z dokumentacją obsługuje wyłącznie tryb non-thinking. W praktycznej próbie możesz zlecić mu naprawę błędu wykrytego przez test w małym repozytorium. Przy każdym uruchomieniu udostępnij te same pliki i narzędzia. Dokumentacja Qwen3-Coder.
Do analizy obrazów potrzebny jest model, który potrafi je przetwarzać. Qwen3-VL-8B-Instruct obsługuje obrazy i tekst, więc można go sprawdzić na zrzutach ekranu, diagramach i skanach dokumentów. Testuj strony podobne do tych, z którymi będzie pracował, także z obróconym tekstem i słabą jakością skanu. Jeden czytelny przykład nie wystarczy do oceny. Dokumentacja Qwen3-VL.
Nazewnictwo zmienia się między generacjami. Qwen3.5-9B zawiera enkoder obrazu, choć nie ma w nazwie oznaczenia „VL”. Zanim wybierzesz nieznaną wersję, sprawdź w jej dokumentacji, jakie dane przyjmuje. Dokumentacja Qwen3.5-9B.
Do wyszukiwania w dokumentach służą osobne modele Qwen3-Embedding i Qwen3-Reranker, dostępne w rozmiarach 0,6B, 4B i 8B. Model embeddingowy przedstawia zapytania i fragmenty tekstu jako wektory. Reranker ocenia trafność znalezionych fragmentów względem zapytania. W asystencie pracującym z dokumentami sprawdzaj wyszukiwanie osobno od modelu, który pisze odpowiedź. Inaczej możesz pomylić brak potrzebnego fragmentu w wynikach wyszukiwania z błędem generowania. Modele Qwen3 do embeddingów i rerankingu.
Sprawdź obie liczby w nazwie modelu MoE
Model mixture-of-experts kieruje każdy token do wybranej części sieci eksperckich. W modelach gęstych nie ma takiego podziału pracy między ekspertów. Według dokumentacji Qwen3-30B-A3B ma 30,5 miliarda parametrów łącznie, z czego 3,3 miliarda jest aktywnych przy przetwarzaniu tokenu. Nadal trzeba przechowywać pełny zbiór wag. Architektura Qwen3-30B-A3B.
Dokumentacja Qwen3-Coder-Next podaje 80 miliardów parametrów łącznie i 3 miliardy aktywnych. Dobierając pamięć i miejsce na dysku, uwzględnij pełny zbiór wag. Program obsługujący model może rozdzielać wagi między urządzenia lub przenosić część z nich do pamięci operacyjnej. Wpływ takiej konfiguracji trzeba zmierzyć na docelowym sprzęcie. Dokumentacja Qwen3-Coder-Next.
Nie wybieraj modelu MoE wyłącznie na podstawie mniejszej liczby. Obok czasu odpowiedzi zapisuj łączną liczbę parametrów, rozmiar pobranego pliku i zmierzone zużycie pamięci.

Uwzględnij pamięć potrzebną podczas pracy
Kwantyzacja zmniejsza precyzję zapisu wag modelu, dzięki czemu zajmują mniej pamięci. Qwen opisuje kilka wariantów kwantyzacji do lokalnego uruchamiania modeli w llama.cpp. Poradnik lokalnego uruchamiania Qwen.
Orientacyjne obliczenie jest proste: osiem miliardów parametrów zapisanych po cztery bity zajmuje cztery miliardy bajtów, jeszcze bez metadanych i pozostałego narzutu. To szacunek rozmiaru wag. Do pracy model potrzebuje dodatkowej pamięci.
Program przechowuje też stan obliczeń podczas przetwarzania rozmowy. Dłuższe dane wejściowe mogą zwiększać zapotrzebowanie na pamięć. Dokumentacja Ollama wskazuje, że wydłużanie kontekstu zwiększa zużycie pamięci, i opisuje ustawienia pozwalające nim sterować. Zacznij od kontekstu, który pomieści dokumenty testowe. Zwiększaj go, gdy wymaga tego zadanie. Długość kontekstu w Ollama.
W pierwszym porównaniu zachowaj ten sam poziom kwantyzacji. Jednoczesna zmiana modelu, precyzji i długości kontekstu utrudnia ustalenie, skąd wzięła się różnica w jakości lub szybkości. Jeśli potrzebujesz mniejszego pliku, po zmianie precyzji ponownie wykonaj ten sam zestaw zadań.
Zapisz konfigurację, którą da się odtworzyć
Po zainstalowaniu Ollama możesz lokalnie wypróbować Qwen3-8B poleceniem:
ollama run qwen3:8b
Polecenie pobiera model, jeśli go brakuje, i rozpoczyna interaktywną sesję. Ten przykład służy do przetestowania modelu tekstowego na sprzęcie z wystarczającą ilością wolnej pamięci. Przed pobraniem sprawdź opis wybranego wariantu. Qwen3-8B w Ollama.
Aby powtórzyć eksperyment, zapisz dokładny identyfikator modelu i sumę kontrolną pliku, wersję programu, kwantyzację, szablon promptu, limit kontekstu oraz ustawienia generowania. Uwzględnij tryb rozumowania, jeśli model go obsługuje. Inna osoba powinna móc odtworzyć konfigurację bez zgadywania, o którego „Qwena” chodziło.
Przed wyborem innego modelu z tej rodziny sprawdź zgodność oprogramowania. Program obsługujący jedną architekturę Qwen może wymagać aktualizacji, aby uruchomić kolejną. Aplikacja musi też obsługiwać rodzaje danych, które zamierzasz do niej przesyłać.
Ustal, gdzie kończy się przetwarzanie lokalne
Ollama deklaruje, że nie otrzymuje promptów ani danych z lokalnych uruchomień. Udostępnia jednak również modele chmurowe i wyszukiwanie w internecie. W dokumentacji opisuje tryb wyłącznie lokalny, który wyłącza te funkcje. Jeśli model ma przetwarzać dane wyłącznie na Twoim komputerze, włącz ten tryb w konfiguracji. Prywatność i tryb lokalny w Ollama.
Następnie sprawdź aplikację korzystającą z modelu. Lokalny model może być połączony ze zdalną wyszukiwarką, magazynem dokumentów, usługą embeddingów lub monitoringiem. Prześledź drogę przykładowego dokumentu przez cały proces i sprawdź, które dane opuszczają komputer. Ustal, jakie prompty i odpowiedzi przechowujesz, kto ma do nich dostęp i kiedy je usuwasz.
W przypadku agenta programistycznego sprawdź również jego narzędzia. Możliwość wygenerowania polecenia powłoki i uprawnienie do jego wykonania to osobne ustawienia.
Oceń model na zadaniach, które ma wykonywać
Przygotuj niewielki zestaw testowy, zanim zaczniesz poprawiać prompty. Przy odczytywaniu danych z dokumentów uwzględnij brakujące pola, niejednoznaczne daty i tabele podzielone między strony. Przy programowaniu wybierz zmiany, których poprawność można sprawdzić testami. Jeśli model odpowiada na pytania o dokumenty wewnętrzne, dodaj także pytania bez odpowiedzi w dostarczonych materiałach.
Dla każdego przykładu określ, jaki wynik uznasz za poprawny. Sprawdzaj zgodność odpowiedzi z faktami i wymaganym formatem. Mierz czas do pojawienia się pierwszego fragmentu odpowiedzi, czas wykonania całego zadania oraz szczytowe zużycie pamięci. Powtarzaj trudne przypadki, żeby pojedyncza udana odpowiedź nie przesądziła o wyborze.
Omów błędy z osobą, która będzie korzystać z wyników. Zapisz, które wymagają poprawki człowieka, a które powinny zatrzymać proces. Zachowaj te przykłady na potrzeby kolejnej wersji modelu lub programu i uruchom je ponownie przed zmianą używanej konfiguracji.