O czym jest ten film
- Greg Isenberg rozmawia z Ryanem, przedstawionym jako członek zespołu założycielskiego Open Code, o modelu Jev. To pokaz możliwości narzędzia, nie niezależne badanie jego skuteczności.
- Według rozmówcy Jev przyjmuje dane i z góry określony schemat wyniku. Zamiast swobodnej wypowiedzi zwraca kategorie oraz oceny liczbowe.
- Główna demonstracja dotyczy około 1700 e-maili: ich kategorii, priorytetu, oceny spamu i potrzeby odpowiedzi. Gość podaje bardzo niski koszt przetworzenia; automatyczny zapis wypowiedzi nie pozwala jednak bez zastrzeżeń ustalić sposobu jego naliczenia.
- Rozmówcy proponują ocenianie zapytań od potencjalnych klientów, porządkowanie archiwum poczty i kierowanie zgłoszeń do odpowiednich zespołów.
- W materiale pojawiają się również prototyp wyboru fragmentów filmu oraz pokaz znalezienia lotu w przeglądarce. Nie jest to dowód, że system samodzielnie dokonał rezerwacji.
- Nieudana próba wykorzystania modelu do sygnałów handlu bitcoinem przypomina o jego ograniczeniach. Ryan zaleca rolę doradczą, a nie powierzanie narzędziu decyzji inwestycyjnych.
- Informacje o zaproszeniach i alternatywnym dostępie przez bramę AI odnoszą się do chwili nagrania. Nie zweryfikowaliśmy obecnej dostępności ani cennika usługi.
10 najważniejszych takeaways — z kontekstem zastosowania
Poniższe zastosowania i środki ostrożności są wnioskami redakcyjnymi z rozmowy. Nie stanowią wyników dodatkowych testów Jeva.
1.Zacznij od wyboru, który chcesz uporządkować
Na czym polega: Rozmówca odróżnia pytanie do chatbota od klasyfikacji danych.
Jak stosować: Przy klasyfikacji najpierw trzeba określić dopuszczalne odpowiedzi: na przykład dział obsługujący sprawę albo stopień pilności.
Na co uważać: W praktyce warto zacząć od jednego powtarzalnego zadania, zamiast od razu automatyzować całą obsługę klienta.
2.Ocena modelu nie jest pewnością
Na czym polega: W demonstracji pojawiają się wyniki procentowe, ale wysoki wynik nie stanowi gwarancji poprawnego rozpoznania.
Jak stosować: Progi, od których zależy dalsze działanie, trzeba ustalić i sprawdzić na własnych przykładach.
Na co uważać: Materiał nie dowodzi, że deklarowane prawdopodobieństwa odpowiadają rzeczywistej częstości trafnych ocen.
3.Koszt pokazu to nie cennik wdrożenia
Na czym polega: Ryan przywołuje kwotę 18 centów przy demonstracji poczty i mówi o kilku dolarach wystarczających na intensywne próby.
Jak stosować: Przed wdrożeniem sprawdź sposób rozliczania usługi, zamiast wyliczać budżet z demonstracji.
Na co uważać: Przed decyzją o wdrożeniu trzeba osobno sprawdzić rozliczenia usługi oraz koszty integracji i kontroli wyników.
4.Szybkość ma sens tylko przy wystarczającej trafności
Na czym polega: Gość mówi o odpowiedziach rzędu 200 milisekund.
Jak stosować: Zmierz na własnych zgłoszeniach zarówno czas odpowiedzi, jak i trafność przypisania.
Na co uważać: Rozsądny test powinien obejmować zarówno czas odpowiedzi, jak i liczbę błędów.
5.Schemat wyniku jest częścią projektu
Na czym polega: W przykładzie poczty kategoria, priorytet i ocena spamu są osobnymi polami.
Jak stosować: Zdefiniuj osobne pola wyniku odpowiadające informacjom potrzebnym w dalszym procesie.
Na co uważać: Wniosek dla wdrożenia: nazwy i granice kategorii powinny odpowiadać rzeczywistemu procesowi, a nie tylko dobrze wyglądać w demonstracji.
6.Archiwum może być miejscem pierwszego testu
Na czym polega: Ryan proponuje przejrzenie dawnych wiadomości w poszukiwaniu pominiętych zapytań handlowych.
Jak stosować: Porównaj oceny modelu z wynikiem znanych, zakończonych spraw.
Na co uważać: Sam wysoki wynik nie uzasadnia jeszcze odnowienia kontaktu — potrzebna jest ocena człowieka.
7.Rozdziel skierowanie sprawy od jej rozstrzygnięcia
Na czym polega: Przypisanie zgłoszenia do zespołu nie jest tym samym co udzielenie odpowiedzi klientowi.
Jak stosować: Zacznij od podpowiadania zespołu odpowiedzialnego za sprawę, bez automatycznego odpowiadania klientowi.
Na co uważać: Można więc zacząć od podpowiedzi dla pracownika, zachowując możliwość poprawienia błędnego przypisania.
8.Punktacja zapytania nie przesądza o wartości klienta
Na czym polega: Gość opisuje ocenianie formularzy w agencji graficznej swojej partnerki.
Jak stosować: Wykorzystuj ocenę do ustalania kolejności obsługi, a nie do bezwarunkowego odrzucania zapytań.
Na co uważać: Warto sprawdzać również odrzucone lub nisko ocenione zgłoszenia, zamiast automatycznie je pomijać.
9.Pomysł biznesowy zaczyna się od kosztownego opóźnienia
Na czym polega: Isenberg proponuje szukać firm, w których napływ spraw długo czeka na pierwszą reakcję.
Jak stosować: Sprawdź, czy szybsze wstępne dopasowanie rzeczywiście rozwiązuje problem konkretnej firmy.
Na co uważać: To pomysł na produkt, nie pokaz gotowego systemu wyceny: nadal potrzebne byłyby dane wykonawców i zasady obsługi zapytań.
10.Nie przenoś wyników z poczty na inwestowanie
Na czym polega: Próba generowania sygnałów kupna, utrzymania i sprzedaży bitcoina wypada w relacji Ryana słabo.
Jak stosować: Ogranicz podobne próby do eksperymentów bez powierzania im pieniędzy.
Na co uważać: Szybkie klasyfikowanie rutynowych spraw nie jest dowodem zdolności do trafnego przewidywania rynku.
Omówienie materiału
Model nie musi prowadzić rozmowy
Najważniejszy temat odcinka nie dotyczy pojedynczego parametru Jeva, lecz sposobu korzystania z AI. Greg Isenberg próbuje opisać narzędzie jako system podejmujący decyzje. Jego gość doprecyzowuje: chodzi o ocenę dostępnych odpowiedzi, a nie o nieomylne rozstrzygnięcie. Użytkownik dostarcza dane oraz schemat wyniku. Zamiast prosić o obszerną poradę, wskazuje, jakie kategorie i wartości są potrzebne aplikacji.
Różnicę pokazuje przykład skrzynki pocztowej. Każda wiadomość zawiera temat, treść i dane nadawcy. Jev ma przypisać kategorię, określić priorytet, ocenić prawdopodobieństwo spamu oraz potrzebę odpowiedzi. Wynik można wykorzystać w programie bez wyciągania informacji z wielozdaniowego uzasadnienia. Nie oznacza to jednak, że model zwraca wyłącznie liczby: w opisie demonstracji występują również zdefiniowane wcześniej kategorie.
Rozmówca nie przedstawia szczegółowej wiedzy o wewnętrznej architekturze. Przyznaje, że nie rozumie jej w pełni. Z jego wypowiedzi można wywnioskować brak widocznego uzasadnienia odpowiedzi, nie zaś z całą pewnością określić wszystkie procesy zachodzące wewnątrz modelu. Eksperyment z wybieraniem kolejnych liter traktuje jako zabawę, a nie jako praktyczny zamiennik generowania tekstu.
Co rzeczywiście pokazano
Najbardziej rozbudowana demonstracja dotyczy około 1700 e-maili. Ryan podaje liczby tokenów oraz niski koszt operacji i żartuje, że zadanie skończyło się, zanim zdążył ponarzekać na czas oczekiwania. To element prezentacji, a nie dowód niezaplanowanego odkrycia. Nie otrzymujemy niezależnej oceny trafności klasyfikacji ani szczegółowego porównania kosztów z innymi narzędziami. Automatyczna transkrypcja dodatkowo komplikuje interpretację wypowiedzi o cenie, dlatego nie traktujemy jej jako podstawy do obliczania budżetu.
Pozostałe przykłady poszerzają obraz zastosowań. Narzędzie do pracy z filmem najpierw przygotowuje transkrypcję, a następnie wykorzystuje klasyfikację do wskazania interesujących fragmentów. Gość relacjonuje otrzymanie 17 propozycji w około trzy sekundy. Nie wynika z tego, że Jev sam transkrybuje wideo ani że cały proces produkcji gotowych klipów trwa tyle samo.
W pokazie obsługi przeglądarki pojawia się wyszukanie lotu z Zurychu do Londynu, według prezentowanej informacji w 7,1 sekundy. Znalezienie połączenia należy odróżnić od jego zakupu. Podawane w rozmowie porównania szybkości z innymi agentami nie są poparte opisem kontrolowanego testu.
Zastosowania i warunki ich sensowności
Rozmowa przechodzi od poczty do obsługi zapytań handlowych. Ryan opisuje agencję graficzną swojej partnerki, która ocenia wiadomości z formularza kontaktowego. Proponuje też sprawdzanie starszej korespondencji i kierowanie zgłoszeń do właściwych zespołów. Isenberg rozwija tę myśl: warto szukać miejsc, w których firma traci czas na wstępne porządkowanie napływających spraw.
Przykład agregatora usług lokalnych pozostaje koncepcją. Klasyfikator mógłby pomóc dopasować zapytanie do wykonawcy, ale rozmówca sam zaznacza, że całość wymagałaby dodatkowej architektury. Wniosek redakcyjny jest więc węższy od obietnicy automatycznego biznesu: szybka ocena danych może usprawnić pierwszy etap obsługi, jeżeli kategorie są użyteczne, a dalsze kroki dobrze zaprojektowane.
Granice pokazuje eksperyment z bitcoinem. Ryan nie jest zadowolony z sygnałów modelu i odradza używanie go przed własnym portfelem inwestycyjnym. Wspomina lepszy rezultat innego systemu, lecz zarazem przyznaje, że porównuje narzędzia o różnym przeznaczeniu. Nie ma podstaw, by z tego fragmentu wyprowadzać rekomendację inwestycyjną dla któregokolwiek z nich.
Odcinek ma wyraźnie promocyjny ton. Informacje o szybkości, cenach i dostępności należy czytać jako deklaracje rozmówców z chwili nagrania. Jego użyteczną lekcją jest rozróżnienie swobodnej odpowiedzi językowej od uporządkowanej klasyfikacji. O przydatności w konkretnej firmie powinien przesądzić własny test, nie tempo ani entuzjazm prezentacji.