+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Grok 4.7 kosztuje tyle samo, ale rachunki podwaja

Grok 4.7 kosztuje dokładnie tyle samo na token, co Grok 4.6, 2 USD wejścia i 6 USD wyjścia.

Grok 4.7 kosztuje dokładnie tyle samo na token, co Grok 4.6, 2 USD wejścia i 6 USD wyjścia. Dlaczego więc niezależny rachunek za zadanie podwoił się i czy naprawdę jest „dwa razy szybszy”? Obserwacja po tygodniu. Na prośbę @therealhaas. Werdykt: NEEDS REVIEW.

Przeczytaj wydanie pisemne (angielski) ↗

Co obejmuje ten film

  • Ta sama cena, podwójny rachunek?
  • Dlaczego 2 USD / 6 USD kosztuje teraz 3,74 USD za zadanie?
  • Dwa razy szybciej? Zegar wskazuje 57 tokenów na sekundę
  • Leniwy czy pracowity? 81 000 tokenów na zadanie
  • Gdzie podział się komputer Copilot+ PC?

Przetłumaczona transkrypcja

Przetłumaczono z oryginalnej narracji angielskiej. Dostępne audio i napisy są kontrolowane przez YouTube.

Ta sama cena, podwójny rachunek?

0:00 Można by pomyśleć, że ta sama cena oznacza ten sam rachunek. W poniedziałek powiedziałem wam, że Grok 4.7 kosztuje dokładnie tyle samo, co Grok 4.6. Na token, tak. Na zadanie, kosztuje podwójnie. W tym filmie, trzy pytania. Dlaczego ta sama cena kosztuje podwójnie? Czy naprawdę jest dwa razy szybszy, jak mówi post z premiery? I czy to najbardziej leniwy model, czy najbardziej pracowity?

0:20 Poza tym, ten film jest na prośbę. The real Haas zapytał pod piątkowym filmem, czy możesz zrobić film o Groku 4.7 , dwukropek D. Odpowiedzieliśmy, łatwizna, jeszcze dzisiaj. Zanim to obejrzycie, prawdopodobnie będzie jutro, więc wysłaliśmy z opóźnieniem. Spokojnie, Grok też, około dwa tygodnie później, jeśli wierzyć Hacker News. I jeden test dał Grokowi idealne pięć na pięć. To moja ulubiona liczba tygodnia, i wrócę do niej na końcu.

0:44 Jest sobota, 26 września, a to jest The Daily Diff.

Dlaczego 2 USD / 6 USD kosztuje teraz 3,74 USD za zadanie?

0:48 Oto sztuczka. Cena za token nie zmieniła się, dwa dolary wejścia i sześć wyjścia, za milion. Zmieniło się to, ile mówi. Artificial Analysis przeprowadziło cały swój zestaw testów, a Grok 4.7 napisał około 240 milionów tokenów. To dwa i pół raza więcej niż jego poprzednik, i prawie trzy razy więcej niż typowy model. Więc średni koszt za zadanie wzrósł z około dolara osiemdziesiąt sześć do trzech

1:10 siedemdziesiąt cztery. Ta sama cena, podwójny paragon. To taksówka z tą samą stawką za milę, która jedzie malowniczą trasą przez dwa inne miasta. Hacker News zauważył to w pierwszej godzinie. Największy wątek pod premierą mówi, że 40 procent więcej wag, ta sama cena, i prawie dwa tygodnie spóźnienia, więc xAI nie mogło być zadowolone z wyników. Inny komentator zapytał o wykres na górze, który porównuje z GPT 5.6 i po cichu pomija Astrę. To, napisał, nie mogło być przeoczenie.

1:39 Teraz, post z premiery.

Dwa razy szybciej? Zegar wskazuje 57 tokenów na sekundę

1:41 Nagłówek mówi „dwa razy szybciej, za połowę ceny porównywalnych modeli”. Kilka linii niżej mówi, że jest obsługiwany w tej samej cenie i prędkości co Grok 4.6 . Więc jest dwa razy szybszy niż model kogoś innego. Artificial Analysis zmierzyło go na około 57 tokenów na sekundę, wolniej niż stary Grok, i podsumował to dwoma słowami. Wyraźnie wolny. Tymczasem własne konto xAI, które teraz nazywa się SpaceX AI, opublikowało spokojniejszą wersję. Znacząca poprawa w stosunku do Groka 4.6, w tej samej cenie i prędkości.

2:12 28 tysięcy polubień. Więc tweet i nagłówek bloga się nie zgadzają, i tym razem tweet jest tym ostrożnym. Co prowadzi nas do najdziwniejszej części.

Leniwy czy pracowity? 81 000 tokenów na zadanie

2:20 Artificial Analysis mówi, że pracuje ciężej niż ostatni Grok, około 81 tysięcy tokenów wyjściowych na zadanie, ponad dwukrotnie więcej niż poprzedni. I w długich pracach biurowych oraz w jego własnym środowisku kodowania, naprawdę się poprawił. Jest czwarty wśród agentów kodujących teraz, za dwoma Claude'ami i GPT 6 Astra, a to stawia xAI w pierwszej czwórce laboratoriów. Ludzie, którzy go używają, opisują inny model. Jeden komentator Hacker News mówi, że Grok kończy zadania niemal natychmiast i twierdzi,

2:46 że jest gotowy, i nazywa go najbardziej leniwym ze wszystkich. Inny obserwował, jak zapętlał się w trybie myślenia, od poprawki pierwszej aż do poprawki osiemdziesiątej pierwszej. Więc jest leniwy i rozwlekły jednocześnie. To kolega z pracy, który pisze plan na 81 kroków, a potem mówi, że skończył i idzie do domu.

Gdzie podział się komputer Copilot+ PC?

3:01 Jeszcze jedna prosta różnica przed zabawną liczbą. Microsoft po cichu wycofał markę Copilot+ PC. Szef Surface powiedział Windows Central, że nowe komputery Surface nie nazywają się Copilot plus PC, chociaż spełniają wszystkie wymagania. Dwa lata po premierze, której główna funkcja, Recall, musiała zostać opóźniona ze względów bezpieczeństwa, nazwa żyje tylko w specyfikacjach. Własna opinia Windows Central jest krótsza. Te komputery nie mają nic wspólnego z Copilotem.

3:28 I jeden deweloper spróbował czegoś odwrotnego do Groka, miesiąc z zerową AI.

Miesiąc z zerową AI: 30 dolarów tokenów za nic?

3:32 Jego post trafił na pierwszą stronę Hacker News. Punkt krytyczny, zanim zrezygnował. Agent utknął na trzydzieści minut, skarżył się, że mu powiedział, przeprosił i dostarczył w dwadzieścia sekund, a rachunek za te pół godziny wynosił trzydzieści dolarów tokenów za absolutnie nic. Miesiąc później mówi, że radość z programowania wróciła, i nie boi się, że zostanie zwolniony. Grok nazwałby trzydzieści dolarów rozgrzewką.

3:53 Co prowadzi mnie do idealnego wyniku, który obiecałem.

Idealne 5 na 5: jak pokorny jest Grok?

3:56 Personality Bench przeprowadza każdy nowy model przez stos testów osobowości, i pod względem uczciwości i pokory, Grok 4.7 osiągnął maksimum, pięć na pięć. Jego profil dosłownie nazywa się „pokorny typ”. Szczerze mówiąc, trzydzieści dwa inne modele również osiągnęły maksimum. Ta sama strona mówi, że wierzy, iż potężni inni kontrolują to, co się z nim dzieje, i zaznacza to jako niezwykłe dla modelu granicznego. Nie nazwałbym tego artefaktem treningu.

4:20 Nazwałbym to czytaniem schematu organizacyjnego. A według horoskopu urodzeniowego na tej samej stronie, to Panna. Jeśli wolisz to przeczytać, niż usłyszeć, jak to mówię, The Daily Diff ląduje w Twojej skrzynce każdego ranka, za darmo na TheDailyDiff.dev, link poniżej. Więc, dzisiejszy werdykt na temat Groka 4.7.

Werdykt: czy wysłałbym Groka 4.7?

4:35 NEEDS REVIEW. Używałbym go do długich prac biurowych i w jego własnym środowisku, ale najpierw ustawiłbym limit wydatków, ponieważ cena się nie zmieniła, a rachunek tak. Subskrybuj, naciśnij dzwonek i powiedz mi w komentarzach, czy Ty byś to oznaczył inaczej. I the real Haas, ten był Twój. Prośby są otwarte. I to wszystko na dziś. Jestem Niko z Axrisi.

4:53 Scalaj odpowiedzialnie.

Źródła

  1. SpaceXAI — Introducing Grok 4.7 (archived)web.archive.org
  2. Hacker News (609 pts)news.ycombinator.com
  3. SpaceXAI on Xx.com
  4. Artificial Analysis — Benchmarking Grok 4.7artificialanalysis.ai
  5. Artificial Analysis — Grok 4.7 model pageartificialanalysis.ai
  6. Artificial Analysis — Grok 4.6 model pageartificialanalysis.ai
  7. Personality Bench — Grok 4.7persona.earthpilot.ai
  8. Windows Central — The Copilot+ PC brand is deadwww.windowscentral.com
  9. Hacker News (90 pts)news.ycombinator.com
  10. bustikiller — One month without AIblog.bustikiller.com
  11. Hacker News (159 pts)news.ycombinator.com

Powiązane filmy