Claude Sonnet 5.5 zasługuje na test w firmowym workflow, ale ustawienie max wymaga osobnego budżetu. W raporcie z 28 września 2026 r. Artificial Analysis podaje 56 punktów i drugie miejsce w Intelligence Index, około 193 tys. tokenów wyjściowych oraz 7,60 USD na zadanie przy tym ustawieniu. Część pomiarów dotyczyła wersji przedpremierowej z błędem obsługi odpowiedzi strukturalnych; autorzy zapowiedzieli ponowne testy. To stan opisanego badania, nie nasz pomiar. Źródło: Artificial Analysis.

Cena tokena a koszt pracy agenta

Anthropic podaje stawki 2 USD za milion tokenów wejściowych i 10 USD za milion wyjściowych. Jednocześnie deklaruje koszt zadania niższy nawet o 30% względem Sonnet 5 we własnych testach. Źródło: premiera Claude Sonnet 5.5.

Porównanie tych komunikatów wymaga znajomości zadań i konfiguracji. Firma wdrażająca agenta potrzebuje odpowiedzi na węższe pytanie: ile kosztuje zaakceptowany wynik w jej procesie? Do rachunku proponujemy wliczać kolejne próby, wywołania narzędzi i czas osoby sprawdzającej rezultat. Przerwane zadanie też zużywa budżet.

Przykładowo agent poprawiający błąd w aplikacji może przejść testy, a przy okazji zmienić publiczny interfejs funkcji. Koszt kontroli takiej poprawki obejmuje wtedy przegląd dodatkowych zmian i ponowny test integracji. Samo zakończenie sesji nie wystarcza do uznania zadania za wykonane.

Komentarz Lazarus Systems: dobierać effort do zadania

W ocenie Lazarus Systems warto rozpocząć porównanie od kilku konfiguracji tego samego modelu. Proponujemy oddzielnie sprawdzić prostą ekstrakcję danych, poprawkę kodu i analizę dokumentów wymagającą porównania źródeł. Dla każdej grupy należy wcześniej ustalić akceptowalny błąd, limit czasu i sposób sprawdzenia odpowiedzi.

Na potrzeby takiego pilotażu wybralibyśmy zestaw zamkniętych zadań z dostępnymi odpowiedziami referencyjnymi. Osoba oceniająca wynik nie powinna wiedzieć, które ustawienie go wygenerowało. Pozwala to ograniczyć pokusę przyznawania wyższych ocen odpowiedziom z droższego wariantu.

Wyższy poziom effort pozostawilibyśmy tam, gdzie poprawia odsetek zaakceptowanych wyników na tyle, by pokryć dodatkowy koszt i czas oczekiwania. Gdy różnica między konfiguracjami jest mała, trzeba powtórzyć próby i obejrzeć konkretne błędy. Jeden udany przebieg nie daje podstaw do zmiany całego workflow. To nasza propozycja oceny wdrożenia; nie przeprowadziliśmy własnego benchmarku Sonnet 5.5.

Niebieskie cząstki rozchodzące się na ciemnym tle.
Ilustracja redakcyjna.

Migracja do Sonnet 5.5 wymaga sprawdzenia integracji

Dokumentacja Anthropic wymienia zmiany niezgodne z wcześniejszą wersją. Ustawienie thinking: disabled zastępuje between_tools, a wymuszanie wywołania narzędzia przez tool_choice: any lub tool zwraca błąd. Domyślny effort w Claude API to high. Źródło: dokumentacja migracji Sonnet 5.5.

Dlatego test migracji powinien objąć również sytuację, w której model odpowiada tekstem zamiast uruchomić oczekiwaną operację. W proponowanym przez nas workflow aplikacja sprawdza typ wyniku i wymagane pola przed zapisem do systemu docelowego. Niekompletne dane trafiają do ponownej weryfikacji. Uprawnienie do zapisu pozostaje osobną decyzją aplikacji.

Sonnet, model lokalny i podział pracy

Dla procesu obejmującego dokumenty wewnętrzne rozważylibyśmy architekturę, w której wyszukiwanie i przygotowanie kontekstu odbywa się w środowisku firmy. Do zewnętrznego modelu trafiałby wyłącznie zatwierdzony zakres danych. Taki podział wymaga sprawdzenia całego przepływu: promptów, logów, załączników i odpowiedzi narzędzi.

W zadaniach o ograniczonym zakresie warto uwzględnić również lokalne modele Qwen. Nasz tekst o Gemini 4 Argon rozwija sposób liczenia kosztu zadania. Oba porównania powinny korzystać z tych samych kryteriów akceptacji, aby wynik pomagał wybrać model do konkretnej pracy.

Jeśli planujesz wdrożenie agentów AI z Lazarus Systems, przygotuj przykładowe zadania, oczekiwane odpowiedzi i listę systemów, do których agent ma mieć dostęp. Na tej podstawie można ustalić zakres pilotażu oraz sprawdzić, czy Sonnet 5.5 pasuje do procesu.

LAZARUS SYSTEMSPorozmawiajmy o Twoim projekcie ↗