O czym jest ten film
- Autor przeznaczył ponad 700 dolarów na porównanie trzech modeli Claude — Haiku 5.5, Sonnet 5.5 i Opusa 5.5 — które za każdym razem dostawały dokładnie ten sam prompt.
- Testowane zadania: gry 3D w 3.js (klon League of Legends, strzelanka w duchu CoD 4, slasher w stylu God of War, piaskownica voxelowa, hybryda Minecrafta i Attack on Titan), gra fabularna na motywach Breaking Bad, strony www (premiera zegarka, aplikacja finansowa Ledgerly), dwuminutowy film o historii lotnictwa oraz audyt z wykrywaniem oszustw.
- Wszystkie prompty i ceny przebiegów są dostępne bezpłatnie w opisie filmu — każdy test można odtworzyć.
- W zadaniu audytowym wszystkie trzy modele wykryły osiem z ośmiu oszustw; różnica ceny między Haiku a Sonnetem wyniosła około 20 centów, a Opus kosztował około 150 dolarów.
- W grach Opus generował najładniejsze światy (cienie, oświetlenie, postacie), ale za cztery–pięć razy większe pieniądze; Sonnet często dorównywał Opusowi jakością.
- Gra na motywach Breaking Bad od Haiku, za 8,87 dolara, okazała się najbardziej grywalna — autor wolał ją od wersji Sonneta i Opusa, zatapianych w niepomijalnych przerywnikach.
- Strona premiery zegarka to bezapelacyjne zwycięstwo Opusa, ale Haiku dostarczył solidny rezultat za mniej więcej jedną piętnastą ceny — do serii stron pod SEO w zupełności wystarczy.
- Dokument o historii lotnictwa wygrał Sonnet, a Opus — mimo wyższej ceny — niewiele odstawał od Haiku; wyniki potrafią być nieintuicyjne.
- Cennik Haiku 5.5: 0,10 dol. za milion tokenów wejściowych i 0,50 za wyjściowe; po przekroczeniu 100 tysięcy tokenów promptu stawka rośnie pięciokrotnie, natomiast odczyty z cache są dziesięciokrotnie tańsze.
- Rekomendacja autora: model klasy Opus planuje pracę, a Haiku wykonuje — streszczenia, klasyfikacja zgłoszeń, odpytywanie baz i research na wielkich zbiorach danych.
10 najważniejszych takeaways — z kontekstem zastosowania
1.Haiku 5.5 kosztuje grosze — 0,10 dol. wejście, 0,50 dol. wyjście za milion tokenów
Na czym polega: To zdecydowanie najtańsza opcja w całym zestawieniu — dziesięć razy tańsza od Haiku 4.5 i czterdzieści razy tańsza od Fable 5.1 na tokenach wejściowych, przy jakości, która — jak pokazał test — nie odbiega proporcjonalnie do ceny.
Jak stosować: Przenieś na Haiku wszystkie masowe, powtarzalne zadania: streszczenia, klasyfikację, odpytywanie baz danych. Przy tej cenie opłaca się wykonać dziesięć tanich przebiegów zamiast jednego drogiego.
Na co uważać: Powyżej 100 tysięcy tokenów w prompcie stawka skacze pięciokrotnie — pilnuj długości kontekstu w dłuższych wątkach.
2.Zadania tekstowe i analityczne osiągnęły sufit — wszystkie modele dostały 8/8
Na czym polega: W teście biegłego rewidenta Haiku, Sonnet i Opus wykryły wszystkie podłożone oszustwa. Różnica w cenie między Haiku a Sonnetem to około 20 centów; Opus — cztery, pięć razy droższy — nie znalazł niczego więcej.
Jak stosować: Przy doborze modelu do analiz, raportów i klasyfikacji kieruj się ceną, a nie marką. Domyślnie Haiku; droższy model zostaw ewentualnie do „opakowania” wyniku na końcu.
Na co uważać: Ładniejsze raportowanie droższych modeli to kosmetyka — merytorycznie wynik bywa identyczny. Nie płać za format.
3.Grywalne prototypy gier 3D za grosze
Na czym polega: Haiku wygenerował grywalne światy w 3.js za ułamki dolara: piaskownicę voxelową za 20 centów, grę fabularną Breaking Bad za 8,87 dolara, hybrydę Minecrafta z Attack on Titan za 5 dolarów. Wersję Breaking Bad autor sam wolał zagrać od droższych odpowiedników.
Jak stosować: Do proof-of-conceptów, jamów i demek − Haiku. Iteruj tanio, a dopiero udany pomysł dopracuj mocniejszym modelem.
Na co uważać: Postacie to pięta achillesowa Haiku („czarny prostokąt” zamiast modelu sylwetki, słabe twarze), podobnie niższa jakość tekstur; balans mechanik bywa kulawy (dający się spamować atak w skoku).
4.Różnica między Sonnetem a Opusem jest mniejsza, niż podpowiada cennik
Na czym polega: W kilku rundach — klonie LoL-a, stronie zegarka, dokumencie o lotnictwie, aplikacji Ledgerly — Opus nie był wyraźnie lepszy od Sonneta, a w filmie o historii lotnictwa wcale mu nie dorównał, mimo że kosztował więcej.
Jak stosować: Zanim sięgniesz po Opusa, przetestuj Sonnenta. W dużej części zadań zaoszczędzisz połowę budżetu bez widocznej straty jakości.
Na co uważać: Są dziedziny, w których Opus deklasuje resztę: wierność postaci, oświetlenie i cienie, efekt „wow” (God of War, Titancraft, rozkładany zegarek).
5.Rezerwuj Opusa na popisy wizualne, Haiku na objętość
Na czym polega: Opus wygrywał tam, gdzie liczył się efekt końcowy: rozkładany na części zegarek, przerażający tytan, combosy w God of War. Haiku wygrywał tam, gdzie liczyły się grywalność i budżet.
Jak stosować: Pracuj „drabiną”: Haiku robi szkice i prototypy, Sonnet dopracowuje, Opus finalizuje wybrane, reprezentacyjne elementy.
Na co uważać: Pojedyncze generacje bywają loterią — Opus też miał migotanie podłogi i fatalnie wyglądającą rakietę. Oceniaj średnią z kilku przebiegów, nie jednym strzałem.
6.Architektura „mózg i palce”: Opus planuje, Haiku wykonuje
Na czym polega: Rekomendowany układ pracy: model z czołówki rozdziela zadania, a Haiku jest wykonawcą — streszcza raporty, klasyfikuje zgłoszenia, odpytuje bazy danych, wyciąga jedną liczbę z dziesięciotysięcznego stosu, jak w analizie oszustw.
Jak stosować: W orkiestratorze agentów deleguj podzadania do Haiku przez API, a wyniki konsoliduj wyżej — kosztem przestaje być ogranicznikiem skali.
Na co uważać: Nie każ Haiku „dokonywać odkryć”. Jego siła to tanie przeskanowanie ogromnych zbiorów, nie synteza koncepcyjna.
7.Próg 100 tysięcy tokenów pięciokrotnie podnosi cenę Haiku
Na czym polega: Dopóki prompt mieści się w 100 tysiącach tokenów, płacisz 0,10/0,50 dol. za milion. Po przekroczeniu progu stawka rośnie do 0,50 dol. wejście i 2,50 dol. wyjście.
Jak stosować: Ucinaj wątki subagentów tuż przed progiem, wyniki kompresuj do streszczenia i podawaj nowemu wątkowi — dzięki temu research na wielką skalę kosztuje ułamek zwykłej ceny.
Na co uważać: Długie, narracyjne łańcuchy rozumowania błyskawicznie rozdymają kontekst — orkiestrator musi na bieżąco liczyć tokeny.
8.Odczyty z cache to dziesiąta część ceny — buduj sesje wielozapytaniowe
Na czym polega: Kolejne pytania w tej samej sesji, dopóki rozmiar promptu trzyma się w limicie 100 tysięcy tokenów, rozliczane są jako odczyt z cache: około 1 centa za milion tokenów wejściowych i 5 centów za wyjściowe.
Jak stosować: Zacznij krótkim zapytaniem (kilka tysięcy tokenów), żeby zbudować cache, a potem w tym samym wątku zadawaj serię pytań — każda iteracja kosztuje grosze.
Na co uważać: Przewaga znika po przekroczeniu progu 100 tysięcy tokenów — wtedy i tak wchodzisz na stawkę pięciokrotnie wyższą.
9.„Sztampa AI” w webdesignie: kursywa plus szeryfy
Na czym polega: Strona zegarka od Haiku cierpiała na typowy wygląd generowanego przez modele designu — nadużywaną kursywę i szeryfowe fonty. Mimo to była lepsza niż połowa internetu, a aplikacja Ledgerly miała lepszy UX niż — w ocenie autora — 90 procent konsumenckich aplikacji na rynku.
Jak stosować: Po wygenerowaniu strony narzuć własny system typograficzny (dobór fontów, hierarchia, światło). To godzina pracy, a wygląd robi się „ludzki”.
Na co uważać: Drobne błędy stanów — np. kolory czcionki psujące się po przełączeniu motywu jasny/ciemny — trzeba wyłapać ręcznym testem obu trybów.
10.Prompty z całego testu są darmowe — porównuj modele na własnych zadaniach
Na czym polega: Autor udostępnił w opisie wszystkie prompty, od klona Minecrafta po analizę oszustw, wraz z cenami i czasami przebiegów. Każdy może odtworzyć test na swojej próbce.
Jak stosować: Wklej własny, produkcyjny prompt do dwóch–trzech modeli, zmierz koszt, czas i jakość, a decyzję podejmij na podstawie kilku powtórzeń, nie jednego strzału.
Na co uważać: Wyniki jednorazowych generacji są zmienne — u Sonneta pojawiły się artefakty wokół budynku, u Opusa migotanie podłogi. Pojedyncza próbka nie jest wyrokiem.
Redakcyjne tłumaczenie
Siedemset dolarów w imię rzetelnego porównania
Przepaliłem ponad 700 dolarów na porównawcze testy Claude Haiku 5.5 z pozostałymi modelami tej rodziny — Sonnetem 5.5 i Opusem 5.5. Generowałem za ich pomocą interfejsy, trójwymiarowe światy, dopracowane prezentacje, a nawet gry — i to takie, w które naprawdę da się grać. Wyniki są ciekawe z trzech punktów widzenia naraz: jakości, szybkości, a przede wszystkim — bo to zapewne najbardziej interesuje widzów — kosztów.
Żeby oszczędzić wam czasu, od razu przechodzę do pokazów. Gdy skończyłem testy, kazałem Haiku złożyć stronę zbiorczą w kilku fajnych stylach; każda runda ma tam swój prompt, który można podejrzeć podczas przewijania. Jeśli któreś demo was zaciekawi — chcielibyście zbudować własną wersję Minecrafta, League of Legends albo coś jeszcze innego — prompty znajdziecie w opisie filmu, całkowicie za darmo. Na stronie umieściłem też ceny poszczególnych przebiegów. Przy Sonnecie porządnie przesadziłem z wydatkami, natomiast Haiku wychodził konsekwentnie wielokrotnie taniej — i na tym skupię się najbardziej. Benchmarki Haiku też się pojawią, ale dopiero pod koniec, bo zależy mi, żeby materiał był jak najprzyjemniejszy wizualnie.
(Informacja dodatkowa: Haiku, Sonnet i Opus to oznaczenia trzech „wielkości” modeli Claude — od najlżejszego i najtańszego po najmocniejszy; wszystkie testowane zadania graficzne powstawały w bibliotece 3.js, służącej do grafiki 3D działającej w przeglądarce.)
Runda pierwsza: mobilna arena w stylu League of Legends
Pierwsza gra to klon League of Legends. Wszystkie trzy modele dostały identyczne polecenie: „Zbuduj trójwymiarową, mobilną arenę bitewną inspirowaną League of Legends w 3.js. Pełny mecz jeden na jeden na zwartym terenie z dwiema liniami, w klasycznym ukośnym widoku z góry”. (Informacja dodatkowa: League of Legends to najsłynniejszy przedstawiciel gatunku MOBA — drużynowych potyczek, w których bohaterowie pchają linie, burzą wieże i niszczą centralny budynek przeciwnika, tzw. nexus.)
Haiku ukończył zadanie za mniej niż 10 dolarów; praca zajęła mu około 3 godzin i 46 minut i pochłonęła ponad 90 milionów tokenów. W pakiecie dostałem poradniki dla graczy i zestawienia „przed i po”. Gra nazywa się Riftbound. Mogę regulować poziom grafiki, pchać linie, burzyć inhibitory i rozbijać nexus, a także wybrać jednego z wielu bohaterów — ja, jako fan magów, wybrałem Lyrę Stormcaller.
Wchodzę do gry. Grafika na ziemi wygląda całkiem nieźle. Co się stanie, gdy podniosę poziom umiejętności i jej użyję? Arcbolt — o, ładnie. Kto nie grał w LoL-a, powinien wiedzieć, że to w gruncie rzeczy ten sam typ gry, tylko oczywiście z o wiele lepszą grafiką. Skoro już przy niej jesteśmy: gra dała mi kilka trybów jakości, wybrałem najniższy, bo mam odpalonych kilka rzeczy w tle. Jest błysk, jest leczenie. Szczerze mówiąc, trudno o bardziej dosłowne przepisanie LoL-a. Nagród za to nie zdobędę. Zobaczmy, co zrobiły Sonnet i Opus.
Sonnet nazwał swoją wersję Eel: Nexus Clash. Po wciśnięciu „play” wybieram bohatera — klikam Morella i ruszam na mapę. Od razu gra muzyka w tle, której nie puszczę, żeby nie zagłuszać komentarza. I pierwsza rzecz, która rzuca się w oczy: grafika Sonneta nie ma nic wspólnego z tym, co widzieliśmy przed chwilą — przepaść. Całość jest znacznie bardziej wymagająca obliczeniowo, więc komputer przycina, a gdy pojawiły się pomagierze, zaczęły się gubić klatki. Nie będę przechodził całej gry — zakładam, że jest w połowie grywalna — ale samo to już robi wrażenie. Są nawet dymki z podpowiedziami przy rzucaniu zaklęć. Dotarłem do połowy mapy. O, nadciąga Sable — prawie jak Fable. No to zjedźmy Fable’a… a skoro przy nim jesteśmy, zobaczmy, co zrobił Opus.
I na pierwszy rzut oka… wcale nie wygląda na dużo lepszego od Sonneta. Powiedziałbym wręcz, że jako całość wypada odrobinę gorzej. Ciekawostka: kreator postaci jest nieco wyższej jakości, ale sama postać u Sonneta wyszła ładniej. Za to dymki z opisami są dłuższe i dopracowane, a zaklęcia chyba czystsze. Słowem: nic szokującego, ale wygląda dobrze. Gra sama przełączyła mi ustawienia grafiki, co robi wrażenie, choć łapię drobne przycięcia.
Patrząc na ceny: może Sonnet był pięć razy lepszy od Haiku, ale był też pięć razy droższy. I od razu nasuwa się pytanie — co by wyszło, gdyby na klon LoL-a wydać przy Haiku tyle samo, ile przy Sonnecie? Ciekawostka: oba modele pracowały nad tym mniej więcej tyle samo czasu, mimo że Haiku zużył mniej tokenów.
Runda druga: Breaking Bad jako przygodówka
Teraz coś fabularnego. Każdemu z trójki zleciłem grę opartą na Breaking Bad. (Informacja dodatkowa: Breaking Bad — serial o nauczycielu chemii, który po diagnozie raka zajmuje się produkcją metamfetaminy.)
Klikamy. Gra nazywa się Hion — mam nadzieję, że nie kaleczę nazwy. Powolna panorama Albuquerque w Nowym Meksyku, światło tak ostre, że „wypłukuje słowa ze strony”. W tle leci prolog: „Przez dwadzieścia dwa lata Owen Mercer uczył chemii w Ridgeline High. Nic nie zmienia się przez przypadek. Ludzie znajdują powód. Reszta to cierpliwość”. A potem — rak. I gramy.
Oho. To ja — Owen. Popatrzcie na to otoczenie, to jest wysoki lot. Widzicie w ogóle te tekstury na deskach? Rozmawiam z Leną: „Siedzisz w podjeździe od czterdziestu minut. Owen, sąsiedzi myślą, że czekasz na pizzę. Ja myślę, że robisz minę, którą robisz, gdy już coś postanowiłeś, i sprawdzasz, czy zauważyłam”. Mam wybór: powiedzieć żonie o diagnozie czy stwierdzić, że to po prostu gorszy tydzień w szkole? Wybieram szkołę. Mogę sprawdzić pocztę, pogadać z synkiem Theo — tym razem bez kul — a nawet się wykąpać. Jakość tej gry jest po prostu niedorzeczna jak na tę cenę. Nie wiem, skąd ta dysproporcja między otoczeniem a postaciami; ludzie we wszystkich generacjach Haiku wychodzili słabo. Ciekawe, jak poradzi sobie Sonnet.
Wersja Sonneta od początku kusi klimatem. I przyznaję: gdy zlepia się wysokojakościową twarz wygenerowaną przez model obrazowy z resztą postaci, to boli. Rozumiem jednak intencję — Haiku, Sonnet i Opus próbują tu obejść naturalne ograniczenia 3.js. Gramy dalej: jest scena ze studentami, jest cała wymyślona historia — bardzo klimatycznie. I proszę: wyszedłem „na zewnątrz” i wygląda to dokładnie tak, jak wyobrażam sobie Nowy Meksyk. Sonnet poradził sobie o niebo lepiej. Na ekranie pojawia się interfejs z kategoriami: Cash, Heat, Moth i Family. Heat to pewnie poszukiwanie, Cash jak w GTA, a Moth to najwyraźniej literówka od „meth”. Do tego punkty rodziny. No i proszę — dobry stary Walter White spaceruje po mapie. Generacja Sonneta jest zdecydowanie lepsza, choć nie chcę wiedzieć, co wisi mu między nogami; trochę strach. Wchodzę do domu, dołączam do rodziny. „No proszę — 52”. Czyli urodziny, tyle że córka zamiast syna. I dokładnie w momencie, gdy mam im powiedzieć o raku, dzwoni dzwonek do drzwi. O, cześć, Roy.
A to wersja Opusa: „Będą mówić, że byłem potworem. Będą mówić, że byłem dobrym człowiekiem, który zszedł na złą drogę”. Ciekawe, że każdy z modeli podeszedł do tematu od innej strony. Opus ma zdecydowanie najlepszą wierność postaci — Haiku i Sonnet w tej kategorii wypadły blado. Ale biorąc pod uwagę, ile zapłaciłem Haiku za te tekstury na zewnątrz… nie, to nie jest aż o tyle lepsze. Mam u Opusa kody poszukiwania, lojalność, rodzinę, podejrzliwość; mogę przeglądać pocztę; jest cała historia, co ciekawe podkreślam — wymyślona od zera.
Bilans rundy: za 8,87 dolara Haiku zrobił wersję, w którą naprawdę chce się zagrać — i to on tu definitywnie wygrywa. Wersji Sonneta i Opusa bym nie ruszył, głównie przez sterty niepomijalnych przerywników. Świat od Haiku był po prostu najbardziej „prawdziwy”.
Runda trzecia: strona premiery zegarka
Mam w zanadrzu jeszcze mnóstwo gier, ale sedno sprawy jest inne: to nie jest generator gier. Generuje znacznie więcej. Zobaczmy stronę premiery zegarka. Haiku kosztował około 30 dolarów, Opus — prawie 55. Dostajemy witrynę z trójwymiarowym zegarkiem; w miarę przewijania koperta rozkłada się na części i widać działający mechanizm — a to niezłe. Nagród nie zdobędziemy, ale wszystkie te elementy — koła zębate, całą grafikę — wygenerował Haiku. Można się tym bawić, a reszta strony jest całkiem sensowna. Znajoma „sztampa AI”: kursywa i szeryfowe fonty. Mimo to szacunkowo lepsza niż połowa internetu. Działa nawet rezerwacja — w frankach szwajcarskich, co mi się podoba — i jest mała sekcja FAQ.
Porównajmy z Sonnetem. Tu zdecydowanie wyżej poprzeczka: można zanurkować znacznie głębiej w zegarek, rozkładanie na części jest o klasę lepsze, a do tego przybliżamy poszczególne elementy mechanizmu. Z trzech dotychczasowych pokazów wynika coś, czego nie zamierzałem pokazywać: różnica jakości między Sonnetem a Opusem jest o wiele mniejsza, niż ludzie zakładają. Sonnet jest, nie ukrywajmy, cholernie ładny — wyraźny skok nad Haiku, choć za to odpowiadający skok w cenie.
A oto strona od Opusa — i to jest popis. Cudowny widok zegarka rozkładającego się przy przewijaniu, przejścia między sekcjami, trójwymiarowa wizualizacja — a sekcja startowa, widoczna od razu bez przewijania, po prostu zachwyca. Niepodważalny król tej rundy. Mamy różnorodne style, a strona tłumaczy niemal od podstaw molekularnych, dlaczego ten zegarek jest taki dobry. Zwycięstwo Opusa — trzeba jednak uczciwie przyznać, że Haiku też zrobił piekielnie dobrą robotę, za mniej więcej jedną piętnastą ceny. Jeżeli potrzebujesz wyprodukować całą serię witryn, powiedzmy pod SEO, to jest to zdecydowanie właściwa droga.
Runda czwarta: biegły rewident szuka ukrytych oszustw
Czas na zadanie biznesowe. Prompt: „Jesteś biegłym rewidentem zatrudnionym przez komisję audytową Northwind Trail Co., detalisty sprzętu turystycznego. Oto dane. Twoim zadaniem jest znaleźć podłożone oszustwa — pracownicy defraudowali firmie w sumie około 391 tysięcy dolarów”. I mówię wam: danych było zatrzęsienie, ogromne pliki CSV.
Ciekawostka: Haiku, Sonnet i Opus uzyskały w tym zadaniu wynik osiem na osiem. Wszystkie przeszły dane i wykryły każdą próbę oszustwa. Haiku przygotował cały raport audytowy — rozpisane pozycje zobowiązań, kwoty zagrożone według kontrahentów i tak dalej. Nie powiem, żeby opakowanie było najpiękniejsze, ale robotę wykonał: wszystkie schematy wyłapane. Sonnet i Opus osiągnęły praktycznie ten sam rezultat — ósemkę — ani szybciej, ani lepiej. Opus może przedstawił informacje odrobinę ładniej, ale sam śledczy dochód był u wszystkich identyczny.
Uwaga na ceny: między Haiku a Sonnetem różnica to jakieś 20 centów, natomiast między Haiku a Opusem cztero-, pięciokrotność — czyli te 150 dolarów. Jaki z tego wniosek? Haiku świetnie radzi sobie z tekstem. Dziś porównania modeli na zadaniach tekstowych w gruncie rzeczy się „nasyciły”: praktycznie każdy — od piórkowego lekkiego po ciężką skrzynię — poradzi sobie z tekstem znakomicie. W wielu obszarach naprawdę zbliżamy się do tego „momentu AGI”.
Runda piąta: strzelanka w stylu Modern Warfare
Wracamy do gier. Zleciłem Claude’om odtworzenie — a właściwie zbudowanie czegoś na wzór — Modern Warfare: „Zbuduj strzelankę pierwszoosobową inspirowaną Call of Duty 4: Modern Warfare (2007) w 3.js, z rzekomo kinową misją kampanii”. Zobaczmy, jak Haiku wypadł na tle Sonneta i Opusa.
Haiku nazwał grę Gray Lantern. Wchodzę do areny, biorę karabin i gram. Przeciwnik po tamtej stronie — udało się, mam go! Są kolejni boty. Granat pod G, choć bez animacji. Kurczę, jaki ja w tym słaby. Mam także granat oślepiający. Nie ukrywam — boty są dość toporne. Jest mapa pokazująca pozycje wrogów. Uczciwie: zupełnie przeciętny FPS; robiłby wrażenie dziesięć czy dwadzieścia lat temu, dziś nagród nie zdobędzie. Tekstury słabe — może to kwestia gatunku — ale cieniowanie całkiem sensowne i widać centralne źródło światła, którego nie widzę, a które technicznie oświetla mapę.
Sonnet: wchodzę na arenę i ruszam. Od razu rzucają się w oczy drobne artefakty wokół domu. Mimo to jakość grafiki jest zdecydowanie wyższa (choć mój poziom gry — niższy). I proszę: boty faktycznie do mnie strzelają, co miło zaskakuje. Podniosę horneta, rzucę granata… Jest nawet animacja skoku. I błagam, nie komentujcie moich umiejętności w CoD — gram na trackpadzie, wy głupcy. Ciekawe, że Sonnet nie wyłapał pewnego błędu; dziwi mnie to. Ale z drugiej strony to pojedynczy strzał, a celem testu nie jest ocena, czy model unika wszystkich jednorazowych wpadek — chodzi raczej o eksplorację realnych światów i uśrednianie wyników.
No i „big daddy”, Opus. Znów arena, biorę karabin wyborowy… może nie powinienem był. Da się przybliżyć? Chyba tak. Ależ ta mapa jest piękna! Dzieje się tu o wiele więcej. To jest przepiękne, panowie — tekstury fantastyczne, wygląda prawie jak prawdziwy Modern Warfare. Bohater przemieszcza się bokiem, biegnie; chyba potrafi też kucnąć? Nie jestem pewien. Słowem: poziom Counter-Strike’a. Opus oczywiście jest tu faworytem i nigdy nie było o tym dyskusji. Jedyne, co mi przeszkadza, to lekkie migotanie podłogi — pewnie kwestia oświetlenia. Bardzo dobre rzeczy. A tak przy okazji: sami będziecie mogli je budować. Przyznam, że przewiduję kłopot z „wireheadingiem” w najbliższej przyszłości, gdy każdy z nas dostanie możliwość tworzenia własnych gier. Spróbuję jeszcze strzelić tego panu bez celowania, z obrotem… Dobra, wystarczy. Zamknę, zanim się ośmieszę.
Koszty: Haiku — 5,70 dolara; Sonnet wyszedł najdrożej, 27 dolarów; a Opus zbudował o wiele bardziej efektowną i ciekawszą grę za 20,78.
(Informacja dodatkowa: „wireheading” — termin z badań nad AI oznaczający pobieranie nagrody bez wysiłku i realnego osiągnięcia; tu w przenośni: granie bez końca w gry tworzone na własne zamówienie.)
Runda szósta: historia lotnictwa jako zadanie filmowe
Teraz „historia lotnictwa” jako zadanie wideo: dwuminutowy dokument mający pokazać zdolności wyjaśniające modeli. Moim zdaniem modele stają się dziś edukatorami w takim samym stopniu, w jakim są narzędziami do wykonywania pracy. Prompt: „Zrób dwuminutowy film o historii ludzkiego lotu — od pierwszych latawców i szybowców po rakiety wielokrotnego użytku lądujące pionowo”.
Haiku zrobił to za mniej niż dolara. W tle leci komentarz, a całość jest całkiem ładna. Co mi się podoba: to wszystko grafiki wektorowe (SVG) modyfikowane w czasie rzeczywistym. Odtwarzam pierwsze sekundy — sekwencja tytułowa. „Historia lotu. Ponad dwa tysiące lat temu w Chinach latawce już wznosiły ludzkie spojrzenia ku niebu”. „Skrzydła Ikara topnieją i spada z nieba”. Teksty przelatują za szybko, żebym zdążył je sensownie odczytać na głos — tempo jest zawrotne — ale historię lotu film faktycznie opowiada, głównie sylwetkami w stylu Flasha. Bardzo ciekawe.
Sonnet: tu od razu widać różnicę w klasie. Samo intro jest o wiele ładniejsze, choć znowu łapię dziwne artefakty. To, że wszystko narysowano wektorowo, robi robotę. Bardzo podoba mi się scena z Leonardem da Vinci zapełniającym notatnik — linie w zeszycie rysują się na żywo. Ten fragment jest prześliczny. Sonnet po prostu rozumie wierność wizualną o niebo lepiej niż Haiku. To jest chyba najładniejsza scena trójwymiarowa, jaką dotąd widziałem. Zobaczmy, czy będzie jeszcze ładniej… O mój boże, będzie! Wreszcie samoloty, Boeingi, wyścig kosmiczny i rakiety wielokrotnego użytku. Bardzo, bardzo fajnie.
Opus za 7 dolarów: nie wiem, dlaczego, ale naprawdę nie jestem pewien, czy jest tu lepszy od Sonneta. W grach — tak, bez dyskusji. Ale to wygląda na jakość zbliżoną… do Haiku! Jest więcej warstw w tle, ale i tak zaskakuje, jak bardzo podobne do siebie są te wyniki. O, to jest naprawdę fajne: piórko rysuje, a potem to rysowanie jest animowane. Przechodzimy do ery odrzutowców… i proszę — przed chwilą mieliśmy piękną scenę trójwymiarową, a teraz ta rakieta wygląda fatalnie. Widzimy więc, jak głęboko „nasycił się” rynek modeli. I przyznam — cieszę się, że mogłem wydać te pieniądze, żeby pokazać wam, jak bardzo podobne do siebie, a zarazem nieintuicyjne potrafią być wyniki. Tutaj bez wahania wybrałbym wersję Sonneta. Co ciekawe, Sonnet kosztował przy tym zadaniu więcej niż Opus i Haiku.
Runda siódma: piaskownica voxelowa à la Minecraft
Prompt: „Zbuduj grywalną piaskownicę voxelową w stylu Minecrafta w index.html, używając 3.js z CDN; świat generowany proceduralnie” — i tak dalej. Zobaczmy, co Haiku potrafi dosłownie za grosze: 20 centów, 13 minut pracy i 2,2 miliona tokenów.
Klikam, startuję. I owszem — to wygląda jak Minecraft. Cakiem blisko oryginału. Oczywiście nie tak dobre; pierwsza niedogodność: nie bardzo umiem wydostać się z tej dziury. A co, jeśli w górę? I czy mogę coś położyć? Mogę! Nie jest to najładniejszy minecraftowy świat w moim życiu, ale nie ma złudzeń: jestem w Minecraftie. Kto nie grał — tak mniej więcej wyglądała ta gra w dniu premiery. Przy okazji: jedna z najbardziej wciągających gier w historii. To właśnie ona wciągnęła mojego wspólnika w biznesie w automatyzację AI, bo potrafił budować te systemy z redstone’a. To jest zwariowane.
Teraz Sonnet — i szczerze mówiąc, oniemiłem. Taka wierność wizualna, tak wiele bliżej prawdziwego Minecrafta. „Realistycznie” to złe słowo, w końcu to gra — ale jednak. Mamy nawet klocki w dłoni, możemy je podmieniać, coś kłaść. Światy są wyraźnie większe — może działa jakaś optymalizacja pamięci, nie wiem. Robi to wrażenie.
Na koniec Opus z grą Blockland — w stu procentach proceduralną. Tu Opus deklasuje wszystkich i nie ma o czym dyskutować. Są cienie, a całość wygląda o niebo lepiej. Jestem wielbicielem tego, co tu zrobił. Zobaczmy, co się stanie, gdy będę kopać naprawdę głęboko. I czy grozi mi cokolwiek związanego z oddechem — bo to raczej świat otwarty, bez trybu przetrwania, ale nic nie wiadomo. Wychodzi na to, że przeczekuję wodę, ląduję pod podłogą świata i… już nie wyjdę, chyba że zbuduję sobie własne schody. A tego robić nie zamierzam.
Runda ósma: Ledgerly, czyli aplikacja do finansów osobistych
Kolejne porównanie: aplikacje internetowe. Prompt: „Zbuduj Ledgerly — fikcyjną aplikację internetową do finansów osobistych: działającą aplikację jednostronicową, dopracowaną jak wypuszczony produkt SaaS; taki interfejs, który trafia na Dribbble”. Generacja Haiku pochłonęła około 50 centów i niespełna 17 minut, zużywając 7 milionów tokenów. Ciekawostka: pozostała dwójka poradziła sobie odpowiednio tylko z 4 i 3,39 miliona.
Otwieram: oto Ledgerly. Tak wygląda to, co potrafi zbudować Haiku — model, który przy odczytach z cache i promptach poniżej 100 tysięcy tokenów kosztuje dosłownie 1 centa za milion tokenów wejściowych. Mogę dodać wydatek — „Saffron Kitchen”, bardzo satysfakcjonujące — zmienić kategorię, przełączyć tryb jasny i ciemny oraz zresetować demo i zacząć od zera. Są drobne potknięcia: po przełączeniu trybów kolor czcionki się psuje. Ale ogólnie mamy większość elementów działającej aplikacji. I to jest prawdopodobnie lepszy UX niż 90 procent konsumenckich aplikacji na rynku.
To jednak nie może się równać z aplikacją Sonneta. Klasa sama w sobie: „Dzień dobry, Maya. Wydałaś o 218 więcej niż w poprzednich trzydziestu dniach — rzut oka na budżety powinien pomóc”. Piękne wykresy, bardzo czysty układ, a do tego cel oszczędnościowy, którego Haiku nie wymyślił. Podoba mi się ta tabela i to, jak fonty szeryfowe i bezszeryfowe spotykają się w jednym spójnym designie — miło na to patrzeć. Można wyeksportować wszystko, nawet do CSV. Odtworzyli kompletny interfejs. Mogę zasymulować błąd, żeby zobaczyć, jak wygląda obsługa awarii, a także wczytać dane demo albo dodać własne transakcje. Bardzo dobra robota, Sonnet — jakością zdecydowanie ponad Haiku, ale za około pięciokrotność ceny.
Otwórzmy Opusa i sprawdźmy, czy to naprawdę „Magnum Opus”. Wiecie co? Nie sądzę. Może to kwestia doboru fontu, ale moim zdaniem jakość jest niższa niż to, co widzieliśmy przed chwilą. Może działa lepiej na dłuższą metę — jest żwawy, responsywny — ale nie nazwałbym tego lepszym, panowie. Naprawdę bym się nie podpisał. Są za to smaczki: Shift+D przełącza motyw, a wyszukiwanie pod Cmd+K pozwala skoczyć wprost do transakcji — wpisuję „shell” i ląduję dokładnie tam, gdzie trzeba (część ukryta za moją głową, przepraszam). Krótko mówiąc: bardzo porządna robota na polu aplikacji.
Runda dziewiąta: God of War w 3.js
Haiku zbudował tę grę za około 10 dolarów, Sonnet za 34, a Opus za 42. Nie dziwię się, że konto ostatnio świeci gołymi dniami. Prompt: „Zbuduj trójwymiarową grę akcji inspirowaną God of War (2005) w 3.js: hack and slash w widoku trzecioosobowym, z brutalną, ciężką walką w greckim świecie mitów”.
Haiku — Ashes of the Oath. O, wąż w tle — fajnie. Pomijam większość fabuły… i to jest to? Dobrze. Przyznam: jestem lekko przerażony i nie do końca wiem, co się dzieje. Moja postać ma zamiast czegokolwiek zwykłego czarny prostokąt. Co się stanie, gdy zaatakuję? Trochę dziwnie, ale — mam ciosy! Te szkielety są naprawdę potężne. Potrafię skakać, muszę tylko przestawić kamerę. O, ładnie: atak w skoku. Tylko że jest wyraźnie mocniejszy od pozostałych ciosów — i można go bez końca powtarzać. Gdybym naprawdę grał w tę grę, robiłbym wyłącznie to, bo to ewidentnie wygrywający ruch.
Sonnet za 34 dolary — Ashen Wrath: Chains of the Drowned God. Znów bardzo hardcore’owo, bardzo metalowo — metal był w tym modelu chyba od pierwszego dnia. O, fajnie: mamy przerywnik w grze. I to wszystko działa w 3.js. Teraz wygląda znacznie lepiej — zbliżamy się do tego, jak God of War wyglądał naprawdę. Nie powiem, że identycznie, ale nieźle, nieźle. I uwaga: ataku już nie da się spamować — naprawili. Choć w powietrzu można zawisnąć bez końca. Pobijmy kilku wrogów. No dawaj, walnij mnie… jestem gotowy! Dobra, może tego nie róbmy. O, to nie dobrze. Możemy blokować i parować pod E — wygląda obiecująco. Zobaczmy… Proszę, zdmuchnę tego pana. I tego również. A, mamy nawet scenę w zwolnionym tempie — ładny detal.
Na koniec rzekomy „Magnum Opus” — Ashes of Sparta: Chains of Wrath. Mam tryby do wyboru; wybieram spartański, bo rodzina podobno wywodzi się ze Spartan, wierzcie lub nie. J — lekki atak. Tak, to zdecydowanie wygląda najlepiej. Łączymy ciosy w combosy — a przecież właśnie dla combosów grało się w God of War. Podoba mi się też, że od razu wskoczyliśmy w walkę. Zobaczmy, jak działa parowanie… Cudownie. Ciągniemy te ataki dalej. Wszystko dzieje się w zwolnionym tempie, więc łatwo — ale wystarczy tych ocen na dziś.
Runda dziesiąta: Attack on Titancraft
Na deser mały zwiastun „Attack on Titancraft”. Widziałem to krążące po X i bardzo mnie zaciekawiło: to połączenie Minecrafta i Attack on Titan z trybem kampanii, w którym trzecioosobowa postać lata na linach jak bohaterowie anime. (Informacja dodatkowa: Attack on Titan — anime o walce ludzkości z gigantami; bohaterowie używają sprężynowego sprzętu na gaz, a tytana zabija wyłącznie cięcie w kark.) Zabawa przednia — muszę tylko znaleźć tytanów do sprania. I to, że zrobił to Haiku, jest o tyle ciekawe, że pamiętacie jakość jego Minecrafta? Cieni tam nie było. A tu — pięknie. Wygląda na to, że skończył mi się gaz, a jak wiecie, gaz przy walce z tytanami się przydaje. Nie widzę sposobu, by zabić tego tytana inaczej niż uderzając go w kark, więc tym bardziej nie nastąpi to szybko. Zwiewam stąd. Zauważam, że istnieje jeszcze ryzyko zerwania liny. Ale mechanika — przednia zabawa. Gdy to zobaczyłem na X, od razu pomyślałem: muszę dodać to do nadchodzącego materiału porównawczego, bo to super frajda. Dorzuciłem też Fable 5.1. Ale pomyśleć, że zbudowałem tę grę za dosłownie 5 dolarów! Co prawda 72 miliony tokenów przy Haiku, ale jednak — 5 dolarów.
Teraz wersja Sonneta. Zaczynam kampanię; pojawia się krótki ekran ładowania. Od razu wygląda to o niebo lepiej. Jestem w mieście, cienie znacznie lepsze i wyraźniejsze. Co prawda do Korpusu Zwiadowczego by mnie nie przyjęli, ale po mapie latam całkiem nieźle. No i gdzie te tytany? Krew mnie żąda! O, jest! To, drodzy państwo, jest to, co w branży nazywamy wielkim chłopem. I lecę na niego. Bum! No proszę. Zwą mnie Levi.
Skoro część z was jeszcze nie załapała: całe to porównanie było pretekstem do pogrania w gry. Ale Sonnet spisał się naprawdę dobrze — mniej tokenów niż Haiku, a koszt w podobnej widełce 4,50–5 dolarów. Teraz Opus; dorzuciłem tu również Fable 5.1, bo byłem ciekawy, czy jakość będzie wyższa. Opus ma zdecydowanie najładniejszą wersję. Ten tytan jest po prostu przerażający — jedna z najstraszniejszych rzeczy, jakie w życiu widziałem. I o — mam samouczek przed pierwszą walką; u poprzedników od razu wskakiwało się do akcji. Mechanika to czysta przyjemność: wszystko responsywniejsze i żwawsze niż to, w co grałem przed chwilą. To już chyba kwestia moich braków wprawy, że nie potrafię sprawnie lawirować między drzewami. To jest bardzo przyjemna gra, panowie. Dziękuję niebiosom, że czegoś takiego nie było, gdy byłem dzieckiem — budowałbym własne gry i grał bez przerwy. Skoro technologia poszła tak daleko dziś, wyobraźcie sobie, co będzie za dwa, trzy miesiące. I to nie tylko, jak to będzie niesamowite — ale jak bardzo uzależniające. Ja chce się grać w tego Titancrafta cały dzień.
A dla ciekawych — Fable 5.1. Miejcie na uwadze, że to starsza generacja, wciąż konkurencyjna w testach. Wygląda na to, że radzi sobie dobrze, ale jest odrobinę mniej wciągający: jestem w mieście i nie ma się tu czym zahaczyć liną, a Sonnet rozwiązał ten problem od pierwszego dnia. Jestem poza murami, w Korpusie Zwiadowczym, i ani jednego tytana. Do tego nie mam zapasów — gdyby to była prawdziwa akcja, byłbym skończony. Tytani przyszliby po mnie pierwsi. No, było fajnie.
Cenniki, próg 100 tysięcy tokenów i odczyty z cache
Na koniec kilka twardych liczb. Dotychczasowe cenniki wyglądały tak: Fable 5.1 — 10 dolarów za milion tokenów wejściowych i 50 za wyjściowe; Opus 5.5 — 4 i 20; Sonnet 5.5 — 2 i 10; Haiku 4.5, czyli model poprzedniej generacji — 1 i 5. A Haiku 5.5? 10 centów za milion tokenów wejściowych i 50 centów za wyjściowe. Jest więc bez porównania najtańszym modelem, jaki można dziś rzucić na takie zadania. I mimo tej eksplozji taniości — od Fable do Haiku — jakość generacji nie odbiega proporcjonalnie. Nie powiedziałbym, że generacje Opusa są czterdzieści razy lepsze od Haiku; przepaść jest dużo mniejsza. I właśnie to mnie ekscytuje, bo potencjał zastosowań jest ogromny.
Warto znać próg cenowy przy 100 tysiącach tokenów, bo on podpowiada, do czego modelu używać. Dopóki prompt nie przekroczy 100 tysięcy tokenów, stawka wynosi 10 centów za wejście i 50 za wyjście. Po przekroczeniu progu — 50 centów za wejście i 2,50 dolara za wyjście. A najważniejsze: odczyt z cache to jedna dziesiąta tej ceny. (Informacja dodatkowa: odczyt z cache, po angielsku „cache read”, to korzystniejsze rozliczenie kolejnych zapytań w tej samej sesji, gdy model nie musi od nowa przetwarzać już znanego kontekstu.) Innymi słowy: pierwszy prompt może kosztować 10/50, ale kolejne pytania do tego samego wątku — dopóki rozmiar promptu trzyma się w limicie 100 tysięcy tokenów — rozliczane są po 1 i 5 centów za milion. To otwiera drzwi do naprawdę tanich zastosowań. Ludzie od jakiegoś czasu używają Haiku do researchu: agent Opusa czy Sonneta deleguje podzadanie do lżejszego modelu. Kiedyś takie delegowanie kosztowało 1 i 5 dolarów, dziś dziesiątą część tej kwoty — a z odczytami z cache jeszcze mniej.
Co z tym zrobić? Najpierw krótki, prosty strzał rozpoznawczy — choćby 5 tysięcy tokenów, żeby przejść na terytorium cache. Potem instruujesz swojego orkiestratora, model średniego lub wysokiego szczebla: „w chwili, gdy wątek subagenta zbliży się do 100 tysięcy tokenów, ucij go, weź jego wyniki, skompaktuj je i podaj nowemu wątkowi”. W ten sposób można odrobić góry pracy badawczej — całe życia researchu — za setną część tego, co kosztowałoby to z Haiku 4.5. I nie tylko taniej: jakość researchu i analiz pośrednich też będzie wyższa. Cała idea jest prosta: Opus 5.5 albo inny model z absolutnej czołówki planuje pracę, a Haiku jest twoimi palcami — wykonuje. Streszczenia raportów? Haiku 5.5. Klasyfikacja zgłoszeń? Haiku 5.5. Odpytywanie baz danych? Haiku 5.5. Wyciągnięcie jednej liczby z dziesięciotysięcznego stosu liczb, jak w tej analizie oszustw? Haiku 5.5. Czy Haiku 5.5 dokona najwspanialszych odkryć wszech czasów? Nie. Ale właśnie dlatego, że przy tym koszcie przejrzyje wielokrotnie więcej danych niż Opus — a dziś to koszt, nie jakość, jest dla większości ludzi ogranicznikiem — można z nim zrobić naprawdę fajne rzeczy. A te kilka gier i aplikacji, które wam pokazałem, to tylko eksploracja w tym właśnie kierunku.
Cieszę się, że mogłem wydać ponad 700 dolarów, żeby to wszystko złożyć w całość. Mam nadzieję, że było dla was choć w połowie tak interesujące, jak dla mnie. Chcecie więcej — zajrzyjcie do opisu. Do zobaczenia w następnym materiale. Trzymajcie się.