Claude Sonnet 5.5 zasługuje na test w firmowym workflow, ale ustawienie max wymaga osobnego budżetu. W raporcie z 28 września 2026 r. Artificial Analysis podaje 56 punktów i drugie miejsce w Intelligence Index, około 193 tys. tokenów wyjściowych oraz 7,60 USD na zadanie przy tym ustawieniu. Część pomiarów dotyczyła wersji przedpremierowej z błędem obsługi odpowiedzi strukturalnych; autorzy zapowiedzieli ponowne testy. To stan opisanego badania, nie nasz pomiar. Źródło: Artificial Analysis.
Cena tokena a koszt pracy agenta
Anthropic podaje stawki 2 USD za milion tokenów wejściowych i 10 USD za milion wyjściowych. Jednocześnie deklaruje koszt zadania niższy nawet o 30% względem Sonnet 5 we własnych testach. Źródło: premiera Claude Sonnet 5.5.
Porównanie tych komunikatów wymaga znajomości zadań i konfiguracji. Firma wdrażająca agenta potrzebuje odpowiedzi na węższe pytanie: ile kosztuje zaakceptowany wynik w jej procesie? Do rachunku proponujemy wliczać kolejne próby, wywołania narzędzi i czas osoby sprawdzającej rezultat. Przerwane zadanie też zużywa budżet.
Przykładowo agent poprawiający błąd w aplikacji może przejść testy, a przy okazji zmienić publiczny interfejs funkcji. Koszt kontroli takiej poprawki obejmuje wtedy przegląd dodatkowych zmian i ponowny test integracji. Samo zakończenie sesji nie wystarcza do uznania zadania za wykonane.
Komentarz Lazarus Systems: dobierać effort do zadania
W ocenie Lazarus Systems warto rozpocząć porównanie od kilku konfiguracji tego samego modelu. Proponujemy oddzielnie sprawdzić prostą ekstrakcję danych, poprawkę kodu i analizę dokumentów wymagającą porównania źródeł. Dla każdej grupy należy wcześniej ustalić akceptowalny błąd, limit czasu i sposób sprawdzenia odpowiedzi.
Na potrzeby takiego pilotażu wybralibyśmy zestaw zamkniętych zadań z dostępnymi odpowiedziami referencyjnymi. Osoba oceniająca wynik nie powinna wiedzieć, które ustawienie go wygenerowało. Pozwala to ograniczyć pokusę przyznawania wyższych ocen odpowiedziom z droższego wariantu.
Wyższy poziom effort pozostawilibyśmy tam, gdzie poprawia odsetek zaakceptowanych wyników na tyle, by pokryć dodatkowy koszt i czas oczekiwania. Gdy różnica między konfiguracjami jest mała, trzeba powtórzyć próby i obejrzeć konkretne błędy. Jeden udany przebieg nie daje podstaw do zmiany całego workflow. To nasza propozycja oceny wdrożenia; nie przeprowadziliśmy własnego benchmarku Sonnet 5.5.

Migracja do Sonnet 5.5 wymaga sprawdzenia integracji
Dokumentacja Anthropic wymienia zmiany niezgodne z wcześniejszą wersją. Ustawienie thinking: disabled zastępuje between_tools, a wymuszanie wywołania narzędzia przez tool_choice: any lub tool zwraca błąd. Domyślny effort w Claude API to high. Źródło: dokumentacja migracji Sonnet 5.5.
Dlatego test migracji powinien objąć również sytuację, w której model odpowiada tekstem zamiast uruchomić oczekiwaną operację. W proponowanym przez nas workflow aplikacja sprawdza typ wyniku i wymagane pola przed zapisem do systemu docelowego. Niekompletne dane trafiają do ponownej weryfikacji. Uprawnienie do zapisu pozostaje osobną decyzją aplikacji.
Sonnet, model lokalny i podział pracy
Dla procesu obejmującego dokumenty wewnętrzne rozważylibyśmy architekturę, w której wyszukiwanie i przygotowanie kontekstu odbywa się w środowisku firmy. Do zewnętrznego modelu trafiałby wyłącznie zatwierdzony zakres danych. Taki podział wymaga sprawdzenia całego przepływu: promptów, logów, załączników i odpowiedzi narzędzi.
W zadaniach o ograniczonym zakresie warto uwzględnić również lokalne modele Qwen. Nasz tekst o Gemini 4 Argon rozwija sposób liczenia kosztu zadania. Oba porównania powinny korzystać z tych samych kryteriów akceptacji, aby wynik pomagał wybrać model do konkretnej pracy.
Jeśli planujesz wdrożenie agentów AI z Lazarus Systems, przygotuj przykładowe zadania, oczekiwane odpowiedzi i listę systemów, do których agent ma mieć dostęp. Na tej podstawie można ustalić zakres pilotażu oraz sprawdzić, czy Sonnet 5.5 pasuje do procesu.