O czym jest ten film
- Premiera Cloud Sonnet 5.5 – według autora wyraźny krok naprzód względem Claude Sonnet 5: około 30% szybszy i 30% tańszy w większości zastosowań.
- Cennik: Sonnet 5.5 liczy 2 dol. za milion tokenów wejściowych i 10 dol. za milion wyjściowych; Opus 5.5 – odpowiednio 4 i 20 dol., czyli z grubsza dwa razy tyle.
- Anthropic opublikowało przewodnik wyboru: Sonnet do jasno zakreślonych zadań (codzienne kodowanie, dokumenty, arkusze), Opus do złożonej pracy wymagającej rozwagi i do najtrudniejszych problemów.
- Własna reguła autora: jeśli potrafisz obiektywnie powiedzieć, kiedy praca jest skończona – bierz Sonneta; jeśli dopiero szukasz kogoś, kto pomoże ustalić, co ma wyjść – Opusa.
- Siedem testów na prawdziwych zadaniach: strona sprzedażowa, motion showreel, 90-dniowy plan zdobycia tysiąca subskrybentów, prezentacja inwestorska z arkuszem Excel, prosty przewodnik HTML, panel wiadomości z X i poradnik do filmu na YouTube.
- Wynik 4:3 dla Sonneta – ale wygrywał głównie ceną; przy otwartych, niedoprecyzowanych zadaniach Opus był wyraźnie lepszy.
- Gotowe skille (pakiety instrukcji dla modelu) niwelują różnicę: gdy skill definiuje, co znaczy „dobrze”, mniej inteligentny model po prostu go wykonuje.
- Na siedmiu zadaniach Opus pracował łącznie o 46 minut dłużej i kosztował o 16 dol. więcej – przy nominalnie dwukrotnej cenie różnica w praktyce okazała się mniejsza niż dwa razy.
- Metoda na koniec: przypisuj modele do konkretnych zadań na podstawie własnych testów i zapisuj wnioski na przyszłość.
10 najważniejszych takeaways — z kontekstem zastosowania
1.Kryterium „gotowe” rozstrzyga wybór modelu
Na czym polega: Sonnet 5.5 wypada najlepiej, gdy zadanie ma jasną specyfikację i sposób sprawdzenia wyniku; Opus 5.5 – gdy liczy się osąd, kreatywność i dłuższy horyzont pracy. Potwierdziło to wszystkie siedem testów autora.
Jak stosować: Przed uruchomieniem modelu zadaj sobie pytanie: czy umiem w jednym zdaniu opisać oczekiwany efekt i sposób jego weryfikacji? Jeśli tak – zacznij od Sonnetu. Jeśli odpowiedź brzmi „nie wiem, co ma wyjść, chcę to dopiero ustalić” – sięgnij po Opusa.
Na co uważać: To nie jest reguła sztywna; nawet przy jasnym zadaniu warto czasem dać Opusowi jedną próbę i porównać wyniki.
2.Doprecyzowanie promptu bywa tańsze niż dopłacanie do modelu
Na czym polega: W teście planu 90-dniowego autor wystawił obu modelom bardzo ogólne polecenie i Opus wygrał z przewagą. Sam jednak przyznaje, że przy konkretnej specyfikacji oba modele dałyby podobny efekt – a Sonnet za pół ceny.
Jak stosować: Zanim przełączysz się na droższy model, doprecyzuj polecenie w tańszym: dodaj oczekiwany układ, format, poziom szczegółowości, przykłady.
Na co uważać: Doprecyzowanie kosztuje Twój czas – przy zadaniu jednorazowym szybsza przepłata za Opusa może się po prostu opłacić.
3.Zamiast przepłacać od razu, doprompuj tańszy model
Na czym polega: W teście strony sprzedażowej Opus dał lepszą całość, ale Sonnet – znakomitą sekcję otwierającą. Autor wolałby wrócić do Sonneta z prośbą o podmianę wymyślonej grafiki na prawdziwe zdjęcia produktu i zaoszczędzić około 13 dolarów.
Jak stosować: Gdy wynik tańszego modelu jest bliski celowi, nie przełączaj się na droższy – napisz krótką korektę: „zamień to na tamto, resztę zostaw”.
Na co uważać: Iteracje też kosztują czas i tokeny; policz, czy dwie–trzy poprawki w Sonnecie faktycznie schodzą taniej niż jeden przebieg Opusem.
4.Prowadź mapę „zadanie → model”
Na czym polega: Autor uruchamia te same skille różnymi modelami i notuje, gdzie który wypada lepiej, żeby przy kolejnym podejściu od razu wybierać właściwy.
Jak stosować: Załóż prostą tabelę: zadanie/skill, model, koszt, czas, ocena. Po każdym teście wpisuj wynik.
Na co uważać: Wnioski się dezaktualizują – powtarzaj testy po większych aktualizacjach modeli.
5.Dobrze napisany skill niweluje różnicę w inteligencji
Na czym polega: W teście poradnika YouTube oba modele dały niemal identyczne wyniki, bo skill precyzyjnie definiował oczekiwany format. Tańszy i szybszy Sonnet wygrał bez dyskusji.
Jak stosować: Zadania, które wykonujesz regularnie, opisz raz jako skill: struktura, sekcje, zasady, przykłady. Wtedy nie przepłacasz za inteligencję, której zadanie nie wykorzystuje.
Na co uważać: Skill ogranicza też swobodę modelu – przy zadaniach otwartych zostaw mu więcej przestrzeni.
6.Wymagaj żywych formuł w arkuszach, nie zaszytych liczb
Na czym polega: Modele wygenerowały arkusze z formułami w niemal każdej komórce obliczeniowej – zmiana danych wejściowych przelicza cały plik. Autor podkreśla, że nie znosi statycznych arkuszy, w których każdą poprawkę trzeba zlecać agentowi.
Jak stosować: Wpisz do promptu wprost: „wszystkie obliczenia jako formuły, żadnych zaszytych wartości, dane wejściowe na osobnej zakładce”.
Na co uważać: Model potrafi wymieszać formuły z liczbami wpisanymi na sztywno – po wygenerowaniu przejrzyj kluczowe komórki.
7.Mierz czas, tokeny i dolary w każdym przebiegu
Na czym polega: Autor przy każdym zadaniu notuje czas pracy, tokeny wejściowe i wyjściowe oraz koszt, dzięki czemu decyzje o wyborze modelu opiera na danych, a nie na wrażeniach.
Jak stosować: Po każdym zadaniu zapisz statystyki sesji obok subiektywnej oceny wyniku. Po kilku tygodniach zobaczysz realny „cennik” swoich zadań.
Na co uważać: Koszt pojedynczego przebiegu nie mówi wszystkiego – doliczaj poprawki i drugie podejścia.
8.Nominalna cena to nie realny koszt
Na czym polega: Mimo dwukrotnie wyższych stawek za token, na siedmiu zadaniach Opus okazał się łącznie tylko o około 16 dol. droższy, a w jednym teście był wręcz tańszy i szybszy od Sonneta; zużył też mniej tokenów wyjściowych.
Jak stosować: Nie wybieraj modelu z cennika – patrz na koszt konkretnego typu zadań, zmierzony własnymi przebiegami.
Na co uważać: Przy dłuższych, agentowych zadaniach różnica potrafi jednak zbliżyć się do nominalnej dwukrotności (w teście strony Opus pracował 52 minuty i kosztował około 13 dol.).
9.Rozdzielaj gust od liczb
Na czym polega: W kilku testach rozstrzygał smak: otwarcie strony Sonneta, projektowanie dźwięku Opusa. Autor otwarcie przyznaje, że oceny są subiektywne, i ostateczny osąd oddaje widzom.
Jak stosować: Przy ocenie wyników rozdziel pytania twarde (czy format się zgadza? czy formuły liczą?) od miękkich (czy mi się podoba?) – te drugie testuj na sobie lub odbiorcach.
Na co uważać: „Ładniejsze” nie znaczy „bardziej użyteczne” – panel Sonneta wyglądał skromniej, ale funkcjonalnie niczego mu nie brakowało.
10.Porównuj modele w identycznych warunkach
Na czym polega: Każda para zadań dostawała dokładnie ten sam prompt, oba modele pracowały z tym samym poziomem „effort” (high), a autor ujawniał, która wersja była którą, dopiero po ocenie wyników.
Jak stosować: Testując narzędzia, trzymaj stałe warunki: jedno polecenie, te same ustawienia, ocena „na ślepo”, zanim sprawdzisz etykietę.
Na co uważać: Samo podejrzenie, który model zrobił daną rzecz, potrafi zaważyć na ocenie – dlatego oceniaj wyniki, zanim się dowiesz, kto je wyprodukował.
Redakcyjne tłumaczenie
Wprowadzenie: co testuję i dlaczego
Cloud Sonnet 5.5 jest dostępny i to wyraźny postęp względem Claude Sonnet 5 – pracuje około 30% szybciej i kosztuje o 30% mniej w większości zastosowań. Cały dzień sprawdzałem go na własnych zadaniach: budowaniu stron, zamianie chaotycznych danych w arkusze (w tym plików Excel z różnymi widokami i formułami w każdej komórce), a także w motion designie, montażu wideo, interaktywnych panelach z danymi synchronizowanymi na żywo oraz w zarządzaniu projektami i planowaniu. Na tym wszystkim porównywałem Sonneta 5.5 z Opusem 5.5, żeby było jasne, kiedy sięgać po który model. W każdym zestawieniu pokażę czas pracy, tokeny wejściowe i wyjściowe oraz realny koszt w dolarach.
Fundament: ceny i oficjalny przewodnik Anthropic
Zanim przejdę do pokazów, trzeba ustalić podstawę: ile kosztuje Sonnet 5.5 wobec Opusa 5.5? Z grubsza połowę. Sonnet liczy 2 dolary za milion tokenów wejściowych i 10 za milion wyjściowych; Opus – odpowiednio 4 i 20, czyli dwa razy tyle. Całe pytanie brzmi więc: czy Opus jest dwa razy lepszy i gdzie którego używać?
Anthropic zresztą samo wydało krótki przewodnik. Sonnet 5.5 – do dobrze zakreślonego, codziennego kodowania i poprawiania błędów, do dużej liczby rutynowych zadań programistycznych oraz do dopracowanych dokumentów, slajdów, arkuszy i jednostronnicowych opracowań. Opus 5.5 – do złożonej pracy wymagającej ostrożnego osądu, w tym długofalowego, agentowego kodowania i pracy z wiedzą, oraz do najtrudniejszych problemów, przy których liczy się maksymalna inteligencja.
Najbardziej podoba mi się zdanie na dole: Sonnet 5.5 pasuje najlepiej wtedy, gdy zadanie ma jasną specyfikację i da się sprawdzić wynik. Odczytuję to tak: jeżeli potrafisz obiektywnie określić, kiedy praca jest skończona, zacznij od Sonneta 5.5. Jeżeli potrzebujesz więcej kreatywności – kogoś, kto pomoże ci dopiero ustalić, co to „skończone” ma w ogóle znaczyć, bo sprawa jest oceniana subiektywnie – wtedy moim wyborem jest Opus. A później uruchamiam różne skille na różnych modelach i sprawdzam: w tym zadaniu lepszy Sonnet, w tym Opus. Przy kolejnym podejściu już wiem, po co sięgnąć.
(Informacja dodatkowa: „skill” to w ekosystemie Claude gotowy pakiet instrukcji i dobrych praktyk, który model dostaje jako kontekst zadania.)
Zasady porównania
Każde zadanie dostało dokładnie ten sam prompt, a oba modele pracowały z poziomem wysiłku ustawionym na „high”. Koszty pokazuję z rozliczenia API, nie subskrypcji – i zaraz wyjaśnię dlaczego. Po pierwsze, te kwoty dobrze się korespondują z wykorzystaniem abonamentu. Po drugie, nie wiem, kto z was ma plan za 20, a kto za 200 dolarów miesięcznie. Po trzecie, po prostu uruchamiam wszystko równolegle i nie zamierzam czekać 52 minut na jeden wynik, zanotować procent i dopiero wtedy odpalać kolejny.
Test 1: strona sprzedażowa dla Perkform
Zaczęło się od zadania: angażująca, wciągająca strona, która ma sprzedawać, dla marki Perkform – z pozwoleniem na generowanie grafik w key.ai. Od razu drobna uwaga warsztatowa: model z początku wpisał „G.AI”, więc trzeba było go poprawić na key.ai. Powinienem dodać tę korektę do słownika w Glido, żeby błąd się nie powtarzał. (Informacja dodatkowa: Glido to narzędzie autora kanału; AIS, o którym będzie mowa dalej, to jego społeczność AI Automation Society.)
Nie zdradzam, która wersja jest którą – poznamy to dopiero na końcu.
Pierwsza wersja od razu robi wrażenie: tekst wpływa przy ładowaniu, puszka reaguje na ruch myszy. Zwróćcie jednak uwagę, że puszkę wymodelowano w 3D – to nie jest prawdziwy produkt, piksel w piksel; model musiał ją wymyślić. Nie podoba mi się to, choć efekt wyszedł niezły. Kliknięcie i przeciągnięcie obraca puszkę, a w tle prześwitują napisy „Perkform”. W miarę przewijania pojawiają się smaki – można je przełączać już w sekcji otwierającej. Puszka wypływa z kadru, a dwa napoje – kawa i odżywka białkowa – łączą się w jedną puszkę Perkform. Potem scena z torbą treningową, telefonem i kluczami: zegar przyspiesza, sięgamy po puszkę. Jeszcze sekcja trzech smaków – słony karmel, waniliowe latte, wyrazista mokka – i finał z trzema dynamicznymi puszkami. Całość zaczyna opowiadać jakąś historię.
Druga wersja na starcie nie uderza tak mocno – mniej efektu „wow”. Są warstwy podążające za myszą, klucz na osobnej warstwie, ale sekcja otwierająca wygląda trochę taniej. Przy przewijaniu dwa napoje schodzą w dół, jest podobny motyw płynięcia czasu, tyle że cała uwaga zostaje skupiona w jednym punkcie – to po prostu inna stylistika opowieści. Branding pozostaje spójny, a co ważniejsze: użyto prawdziwego wygenerowanego zdjęcia produktu, zgodnego z wytycznymi marki. To spory plus wobec wymyślonej puszki z pierwszej wersji. Jest też eleganckie zbliżenie na obraz i cała seria niezależnie generowanych grafik. Werdykt: mimo słabszego otwarcia to lepszy wynik całościowo.
Odsłaniamy karty: druga wersja to Opus 5.5, pierwsza – Sonnet. Sonnet zadał klasę w sekcji otwierającej; gdyby dał prawdziwą puszkę, byłby bezkonkurencyjny. Statystyki: Sonnet pracował 28 minut (20 mln tokenów wejściowych, 134 tys. wyjściowych), Opus – 52 minuty (37 mln wejściowych, 148 tys. wyjściowych) i kosztował około dwa razy tyle, czyli jakieś 13 dolarów. Czy wynik Opusa jest dwa razy lepszy? Moim zdaniem nie. Wolałbym wrócić do Sonneta z krótką prośbą: „bardzo dobrze, tylko zamień wymyślone grafiki na nasze prawdziwe zdjęcia” – i za ułamek tej kwoty dostać docelowy efekt. Dlatego punkt dla Sonneta. Ale pamiętajcie: to ocena subiektywna, bierzcie ją, jak wam pasuje.
Wtrącenie: darmowy skill ScrollCraft
Zanim pójdziemy dalej – mam zupełnie darmowego skilla do projektowania stron, ScrollCraft. Używam go przy każdej budowanej witrynie, w tym przy stronie AI Automation Society, którą bardzo sobie cenię. Rozumie animacje sterowane przewijaniem i pracę na warstwach, a przy tym zawiera bloki o „smaku”: typografii, odstępach, głębi. Link znajdziecie w opisie filmu – a my wracamy do testów.
Test 2: motion showreel o Glido
Zadanie brzmiało: „zrób mi motion showreel o Glido; sam zbadaj temat i zadbaj o spójność marki i typografii; to ty jesteś projektantem ruchu – zaimponuj mi”.
Najpierw wersja Sonneta. Cakiem, całkiem – dużo kreatywności w pokazaniu, jak produkt wygląda w użyciu. Na ekranie przelatują przykładowe polecenia: „Refactor this function to use async await instead of promises”, „I will fold those into the next revision. Reply saying it looks good and we can start next week”, „Wire the retry logic to the API client”. Lektor wybrzmiewa jak generowany – sądząc po barwie, pochodzi z ElevenLabs. Fajny moment, w którym piksele układają się w literę „G”, a ta przechodzi w wygenerowane wideo. Szczerze mówiąc, nie spodziewałem się, że Sonnet pociągnie ten pokaz na takim poziomie.
A teraz Opus… moim zdaniem tego nie da się pobić. Po prostu bardziej „glidoowo”: tło, animacje, nawet teksty lepsze. Model wszedł na naszą stronę i wyciągnął stamtąd mój cytat – to dosłownie te słowa z witryny. Wynik zdecydowanie lepszy. Ciekawostka w statystykach: Opus skończył szybciej, zużył mniej tokenów wyjściowych, a mimo to był droższy – 20,55 dolara wobec 14,37 u Sonneta. Nawet gdyby dopchać Sonneta iteracjami do pełnych 20,55 dolara, wciąż uznałbym wersję Opusa za lepszą. Smak w ruchu i w projektowaniu dźwięku to coś, co trudno trafienie załatwić nawet człowiekowi – a Opus robi to konsekwentnie dobrze. Punkt dla Opusa.
Test 3: 90-dniowy plan na tysiąc subskrybentów
Tym razem celowo bardzo ogólne polecenie: „stwórz oparty na badaniach 90-dniowy plan działania, który doprowadzi nasz kanał do tysiąca subskrybentów”.
Drobność techniczna: oba modele zwróciły na start zwykły plik markdown, więc dostały identyczną drugą instrukcję – zamień to na dokument, który łatwiej się czyta. Sonnet zrobił lokalny plik HTML, Opus – artefakt, czyli plik podglądany bezpośrednio w Claude.
Wersja Sonneta: logo AIS Media, data 28 września, punkt startowy i cel dnia dziewięćdziesiątego. Ciekawostka: wybrał start 2 listopada, a nie „w przyszłym miesiącu” albo całym kwartale. Jest oś czasu z odcinkami na dole, progi liczby subskrybentów aż do tysiąca, promocje – testowe wysyłki, pełna lista, sześć maili promujących mój kanał, pięć postów społecznościowych, próg 500 subskrypcji, sekcja „święta zablokowane”. Dochodzą fazy: od października do listopada, dwa tygodnie od premiery, kolejny etap miesiąc później, a na końcu etap „komponowania” wzrostu. Widać kamienie milowe i źródła subskrybentów. Nic nie jest interaktywne – to raczej projektowy szkic tego, jak mogłoby wyglądać. Za to miły detal: treść wpływa razem z przewijaniem. Plan uwzględnia też rolki, LinkedIn, materiały dla gości i karty wyników. Dobre, choć w tej chwili nie pomogłoby mi specjalnie.
Wersja Opusa, również z animacjami przewijania, wybrała okres od 1 października do 29 grudnia – czyli kwartalny sprint Q4, znacznie lepiej zgrany z tym, co dzieje się teraz w firmie. Układ jest inny i moim zdaniem czytelniejszy: od dziś do premiery trwają przygotowania – przyjmowanie zgłoszeń od gości, zapowiedzi, nagrywanie odcinków – a po starcie wchodzą rolki, lista mailowa i posty. Fazy rozbito na miesiące: buduj, wypuszczaj, wzmacniaj. Są źródła subskrybentów (lista, organiczny YouTube, mój kanał) i lista decyzji do podjęcia. A „otwórz pełny plan” prowadzi do bardzo szczegółowego opracowania z odhaczanymi zadaniami – coś, co mógłbym od razu przenieść do menedżera zadań.
Werdykt: Opus, jednoznacznie. Statystyki: Opus 20 minut, Sonnet 14; Sonnet niecałe 5 dolarów, Opus nieco ponad 9. Ale najciekawsza jest tu refleksja, nie liczby. Nie dałem temu promptowi żadnych wytycznych – „oparty na badaniach plan na 90 dni” i tyle. A wcześniej ustaliliśmy: obiektywne kryterium ukończenia – Sonnet; kreatywność i partner do myślenia – Opus. I to jest właśnie przykład szukania partnera, który weźmie ambitny, mglisty cel i po prostu z nim pobiegnie. Gdybym podał obu modelom bardzo konkretną specyfikację – czego chcę, jak ma wyglądać i tak dalej – wyniki byłyby podobne, tylko Sonnet wyszedłby taniej. To dużo mówi o sposobie rozmawiania z tymi modelami. Tutaj jednak nie mogę udawać, że nie widzę przewagi Opusa przy tak ogólnym poleceniu – punkt dla Opusa. Mamy 2:1.
I od razu zastrzeżenie: nie próbuję rozstrzygnąć, który model jest „lepszy”. Opus jest po prostu lepszym modelem – ale chodzi o to, żebyście wiedzieli, kiedy i jak używać każdego z nich.
Test 4: dane firmy – arkusz Excel i prezentacja inwestorska
Modele dostały fikcyjne dane firmy i dwa polecenia: arkusz Excel oraz prezentację dla inwestorów. Bez pomocy skilla – po prostu „zrób mi to”. Zaczynamy od Opusa.
Prezentacja: wygenerowane tło, 18 slajdów, generowane ilustracje; problem, produkt, dla kogo, trakcja (statystyki policzone z dostarczonych danych), model biznesowy, klienci. Nie wygląda źle – na slajdach nie dzieje się za wiele naraz. Zastrzeżenie: to ten znany „claude’owy” font projektowy, z charakterystycznymi „f” i cyframi; moim zdaniem nie wygląda to szczególnie drogo, ale slajdy nie są źle zaprojektowane. Excel: zakładki z pulpitem, danymi wejściowymi, metrykami miesięcznymi i kwartalnymi oraz rachunkiem wyników. Pulpit naprawdę udany – pełno statystyk i wykresów. Najważniejsze: formuły siedzą praktycznie w każdej komórce obliczeniowej, więc zmiana danych przelicza cały arkusz. Nie znoszę, gdy model wypluje statyczny plik z zaszytymi liczbami i każdą poprawkę trzeba zlecać agentowi. Do tego kolorowanie komórek i mnóstwo zakładek. Bardzo dobry wynik.
Ciekawostka: wcześniej to Opus zrobił artefakt, a Sonnet nie – tym razem role się odwróciły. Prezentacja Sonneta („Bright Path Analytics”) ma intro, zarys firmy, problem, produkt, dla kogo, model biznesowy i trakcję – praktycznie identyczna z wersją Opusa, z tą samą czcionką; Sonnet dał wręcz więcej slajdów. Excel na pierwszy rzut oka wygląda na tańszy, ale pulpit jest w porządku: wizualizacje, formuły w komórkach obliczeniowych, rachunek wyników, metryki SaaS, założenia, prognoza organiczna, wyszukiwania między zakładkami. Zakładek mnóstwo: pipeline, klienci, marketing, zatrudnienie. Możliwe, że aż za dużo – przy prawdziwych danych powiedziałbym więcej o użyteczności.
Bilans: w tym zadaniu nie widzę istotnej różnicy jakości. Skoro wyniki są moim zdaniem tożsame, wygrywa ten, który był tańszy i szybszy. I niespodzianka: tym razem Opus był i tańszy, i szybszy. Bez dyskusji – punkt dla Opusa. Gdyby nad tym zadaniem pracował jakiś skill, test mógłby wyjść inaczej, ale tu go nie użyłem.
Test 5: skill „HTML explainer” – jakie modele AI uruchomię na swoim komputerze
Następny przykład już ze skillem – „HTML explainer”. Nie kazałem go użyć, model sam po niego sięgnął. Polecenie: „jakie modele mogę uruchomić na moim sprzęcie? Nic o tym nie wiem, więc wytłumacz prosto, dorzuć dużo obrazków”.
Wersja Opusa, „What AI can my PC run?” – utrzymana w mojej marce, prosta forma: karta graficzna, pamięć, procesor, dysk; porównanie pamięci karty z pecetem do gier i układem z centrum danych; reguła 32 GB – model musi się zmieścić na karcie graficznej, więc modelu 43 GB nie uruchomimy, ale 20 GB już tak. Dalej kwestie przechowywania wag, szybkość w tokenach na sekundę i rekomendacje instalacji: codzienna rozmowa – konkretna sugestia; kodowanie i trudne problemy; Gemma 4 do szybkich odpowiedzi; sekcja „za duże jak na jeden komputer” i na końcu „zacznij dziś wieczorem” z dokładną instrukcją pierwszych kroków. Prosto i konkretnie – nieźle.
Wersja Sonneta, „Local AI models your PC can run”: dorzucił własną miniwizualizację i tytuł-sekcję „32 GB – liczba, która przesądza, co znaczy «lokalne»”. I od razu duży plus: zaczyna od wyjaśnienia, co w ogóle znaczy „lokalnie” – Opus rzucił się od progu w sprzęt. Dalej proste rozłożenie tematu z wizualizacją: trzy miejsca na model – biurko, półka, magazyn; szybko, wolno, tylko przechowywanie. Sekcja „co się zmieści”: zielony mieści się bez problemu, żółty będzie się wlokł, czerwony nie ruszy. Nie tłumaczy „dlaczego” w kontekście gigabajtów, ale ilustracja jest ładna i pojawia się kilka przykładowych modeli. Jest też szybkość, wybór modelu pod zadanie i instrukcja „jak wypróbować coś już teraz”.
Jak bym sam chciał zrozumieć ten temat? Wyjaśnienie Opusa było lepsze – wersja Sonneta jest bardziej wizualna, ale niestety gorzej tłumaczy. Koszty: podobny czas pracy, a Sonnet przyszedł za pół ceny Opusa (ten zapłacił około 3 dolary). Gdybym dopromptował Sonneta – „nadal nie rozumiem tego, tego i tego, dorzuć informacje” – obstawiam, że wynik wyszedłby lepiej niż u Opusa za 3 dolary. Do tego wizualnie Sonnet i tak dał radę, a to przecież element bardzo prostego, niewypolerowanego skilla. Punkt dla Sonneta.
Test 6: panel wiadomości z X
Polecenie: „przeszukaj X pod kątem dzisiejszych wiadomości i zrób interaktywny panel – żeby widzieć, co się dzieje, co wychodzi i jak się przygotować na wydarzenia w świecie AI”.
Sonnet postawił lokalną stronę. Widać czas ostatniego skanowania i przycisk odświeżania, licznik: 386 śledzonych postów z 676 przeskanowanych. Nagłówki na górze, sekcja „trendy”, filtry: „pasuje do mojego kanału”, ukrywanie omówionych, tylko przypięte. Jest wskaźnik gorąca tematu: Claude Sonnet 5.5 – 100, „meta enterprise platform” – 94. Po najechaniu widać szczegóły, da się otworzyć oryginalny post, oznaczyć temat jako omówiony albo dodać do planu – i z boku rośnie lista planu treści. Sortowanie po najnowszych lub dopasowaniu do kanału, widok ostatnich 48 godzin, sekcja „w tym tygodniu” (DevDay OpenAI) i kalendarz. Naprawdę niezły widok.
Opus od razu wygląda trochę lepiej. Skanowanie X wciąż trwa, z widocznym paskiem postępu, a sam widok jest bardziej rozbudowany: posty na godzinę o AI, tematy, które zyskują temperaturę, i te, które stygną. Jest przełącznik „ten tydzień”, plan treści z możliwością dopisywania pozycji i surowy feed. Wskaźnik gorąca też się znalazł, do tego etykiety: plotka, wypuszczone, dyskusja. Z boku widać prawdziwe posty, a kliknięcie w najlepszy przenosi prosto na X.
I tu zaczynam dostrzegać wzorzec, o którym mówiłem na początku: jeśli wiesz dokładnie, czego chcesz, Sonnet najpewniej da radę. Ale gdy wysyłasz otwarte, bardzo ogólne polecenie, Opus po prostu poradzi sobie lepiej. W tym zadaniu Opus pracował około 7 minut dłużej i kosztował o 6 dolarów więcej. Gdybym iterował z Sonnetem – tyle razy, ile trzeba, żeby dojść do 8 dolarów – ale przy jaśniejszym celu, wynik byłby na poziomie. Nie ma w wersji Opusa niczego, czego Sonnet nie umiałby zaprogramować. Po prostu Sonnet mniej o tym „myśli” i rzadziej wychodzi poza utarty schemat, żeby dodać ci lepsze doświadczenie; odda to, co jego zdaniem chcesz, w wersji podstawowej. Trzymając się mojej reguły – Sonnet był wyraźnie tańszy, więc punkt dla niego. Ale przy jednym promptcie wynik Opusa był lepszy i nie ma co udawać inaczej.
Test 7: poradnik do filmu na YouTube
Ostatnie zadanie: link do jednego z moich filmów i polecenie „stwórz do niego poradnik-zasobnik”. Znów pracował skill – to on w zasadzie definiuje, co znaczy „dobrze”.
Wersja Sonneta: nagłówek AIS, moja czcionka, link do mojego kanału YouTube. Potem wyzwanie i zasady, benchmark S&P, jak zbudowałem system, problem i rozwiązanie, wyniki pierwszego i drugiego dnia, dni od trzeciego do siódmego, wyniki końcowe, wyciągnięte lekcje i kluczowe wnioski na dole. Wersja Opusa ma ten sam link, tytuł i nagłówek: przegląd, zasady, benchmark, jak system powstał, dzień pierwszy, drugi, wyniki końcowe i tak dalej. Praktycznie ta sama długość i struktura – może w wersji Sonneta jest większa przerwa w środku, ale to szczegół.
Skoro wyniki są tak zbliżone, decyduje cena i czas – a Sonnet był około dwukrotnie szybszy i o 1,40 dolara tańszy. Punkt dla Sonneta. I to ciekawa obserwacja: mam skilla, którego często używam, więc model „mniej inteligentny” niż Opus po prostu wykonał instrukcje, bo wiedział dokładnie, czego chcę.
Bilans: 4:3 i co z tego wynika
W całym teście cztery rundy poszły do Sonneta, trzy do Opusa – technicznie wygrał Sonnet, ale rozumiecie, że to nie był pojedynek o miano lepszego modelu, tylko lekcja tego, jak i kiedy każdego z nich używać. Łączne statystyki siedmiu sesji: Opus pracował o jakieś 46 minut dłużej, zużył o około 38 mln więcej tokenów wejściowych – ale mniej tokenów wyjściowych, co ciekawe – i kosztował łącznie o około 16 dolarów więcej. Zważywszy, że nominalnie jest dwukrotnie droższy, w tym eksperymencie nie zapłaciłem za niego dwa razy tyle, i to też jest pouczające.
Dużo mówiłem o tym, jak ja widzę miejsce obu modeli w swojej pracy – mam nadzieję, że teraz wy też lepiej widzicie swoje. Ale ostatecznie musicie wejść sami i przetestować je na własnych skillach, promptach i procesach. To był mój eksperyment na dziś. Mam nadzieję, że czegoś się dowiedzieliście – jeśli tak, zostawcie łapkę w górę, bardzo mi to pomaga. Dziękuję, że dotrwaliście do końca. Do zobaczenia w następnym materiale.