+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Grok 4.7 kostet dasselbe, aber rechnet doppelt ab

Grok 4.7 kostet pro Token genau dasselbe wie Grok 4.6: 2 $ rein und 6 $ raus.

Grok 4.7 kostet pro Token genau dasselbe wie Grok 4.6: 2 $ rein und 6 $ raus. Warum hat sich also die unabhängige Abrechnung pro Aufgabe verdoppelt, und ist es wirklich "doppelt so schnell"? Ein Follow-up eine Woche später. Angefragt von @therealhaas. Fazit: NEEDS REVIEW.

Die schriftliche Ausgabe lesen (Englisch) ↗

Was dieses Video behandelt

  • Gleicher Preis, doppelte Rechnung?
  • Warum kosten 2 $ / 6 $ jetzt 3,74 $ pro Aufgabe?
  • Doppelt so schnell? Die Uhr zeigt 57 Tokens pro Sekunde
  • Faul oder fleißig? 81.000 Tokens pro Aufgabe
  • Wo ist der Copilot+ PC geblieben?

Übersetztes Transkript

Aus der englischen Originalerzählung übersetzt. Verfügbare Audio- und Untertitel werden von YouTube gesteuert.

Gleicher Preis, doppelte Rechnung?

0:00 Man würde meinen, derselbe Preis bedeutet dieselbe Rechnung. Am Montag habe ich Ihnen gesagt, Grok 4.7 kostet genau dasselbe wie Grok 4.6. Pro Token ist das so. Pro Aufgabe kostet es das Doppelte. In diesem Video, drei Fragen. Warum kostet derselbe Preis das Doppelte? Ist es wirklich doppelt so schnell, wie der Launch-Post besagt? Und ist es das faulste Modell oder das fleißigste?

0:20 Außerdem ist dieses auf Anfrage. The Real Haas fragte unter dem Freitags-Video, kannst du ein Video über Grok 4.7 machen, Doppelpunkt D. Wir antworteten, kein Problem, später heute. Wenn Sie dies sehen, ist es wahrscheinlich morgen, also haben wir es zu spät SHIP IT. Entspannen Sie sich, Grok auch, etwa zwei Wochen zu spät, wenn man Hacker News glaubt. Und ein Test gab Grok eine perfekte fünf von fünf. Es ist meine Lieblingszahl der Woche, und ich komme am Ende darauf zu sprechen.

0:44 Es ist Samstag, der 26. September, und dies ist The Daily Diff.

Warum kosten 2 $ / 6 $ jetzt 3,74 $ pro Aufgabe?

0:48 Hier ist der Trick. Der Preis pro Token hat sich nicht geändert, zwei Dollar rein und sechs raus, pro Million. Was sich geändert hat, ist, wie viel es spricht. Artificial Analysis hat seine gesamte Testsuite durchlaufen, und Grok 4.7 schrieb etwa 240 Millionen Tokens. Das ist zweieinhalb Mal mehr als sein Vorgänger und fast dreimal so viel wie ein typisches Modell. So stiegen die durchschnittlichen Kosten pro Aufgabe von etwa einem Dollar

1:10 sechsundachtzig auf drei vierundsiebzig. Gleicher Preis, doppelte Rechnung. Es ist ein Taxi mit demselben Tarif pro Meile, das die malerische Route durch zwei andere Städte nimmt. Hacker News entdeckte es in der ersten Stunde. Der größte Thread unter dem Launch sagt vierzig Prozent mehr Gewichte, gleicher Preis, und fast zwei Wochen zu spät, also können xAI die Ergebnisse nicht gefallen haben. Ein weiterer Kommentator fragte nach dem Chart oben, das mit GPT 5.6 vergleicht und Astra stillschweigend weglässt. Das, schrieb er, kann kein Versehen gewesen sein.

1:39 Nun zum Launch-Post.

Doppelt so schnell? Die Uhr zeigt 57 Tokens pro Sekunde

1:41 Die Überschrift sagt doppelt so schnell, zum halben Preis vergleichbarer Modelle. Ein paar Zeilen tiefer steht, es wird zum gleichen Preis und mit der gleichen Geschwindigkeit wie Grok 4.6 angeboten. Es ist also doppelt so schnell wie das Modell eines anderen. Artificial Analysis hat es mit etwa 57 Tokens pro Sekunde getaktet, langsamer als das alte Grok, und fasste es in zwei Worten zusammen. Bemerkenswert langsam. Inzwischen postete xAIs eigener Account, der jetzt unter SpaceX AI läuft, die ruhigere Version. Eine bemerkenswerte Verbesserung gegenüber Grok 4.6, zum gleichen Preis und mit der gleichen Geschwindigkeit.

2:12 Achtundzwanzigtausend Likes. Der Tweet und die Blog-Überschrift stimmen also nicht überein, und ausnahmsweise ist der Tweet der vorsichtigere. Was uns zum seltsamsten Teil bringt.

Faul oder fleißig? 81.000 Tokens pro Aufgabe

2:20 Artificial Analysis sagt, es arbeitet härter als das letzte Grok, etwa 81.000 Output-Tokens pro Aufgabe, mehr als doppelt so viele wie beim letzten. Und bei langer Büroarbeit und in seinem eigenen Coding-Harness hat es sich wirklich verbessert. Es ist jetzt Vierter unter den Coding-Agenten, hinter zwei Claudes und GPT 6 Astra, und das bringt xAI unter die Top vier Labs. Die Leute, die es benutzen, beschreiben ein anderes Modell. Ein Hacker News-Kommentator sagt, Grok beendet Aufgaben fast sofort und behauptet,

2:46 erledigt, und nennt es das faulste von allen. Ein anderer sah es im Denkmodus in einer Schleife, von Fix eins bis Fix einundachtzig. Es ist also faul und wortreich zugleich. Es ist der Kollege, der einen einundachtzigstufigen Plan schreibt, dann sagt, fertig und nach Hause geht.

Wo ist der Copilot+ PC geblieben?

3:01 Noch ein direkter Unterschied vor der lustigen Zahl. Microsoft hat die Marke Copilot+ PC stillschweigend eingestellt. Der Surface-Chef sagte Windows Central, die neuen Surface-PCs heißen nicht Copilot+ PCs, obwohl sie jede Anforderung erfüllen. Zwei Jahre nach einem Launch, dessen Hauptfunktion, Recall, aus Sicherheitsgründen verschoben werden musste, lebt der Name nur noch auf Datenblättern. Die eigene Einschätzung von Windows Central ist kürzer. Diese PCs haben nichts mit Copilot zu tun.

3:28 Und ein Entwickler versuchte das Gegenteil von Grok, einen Monat ohne KI.

Ein Monat ohne KI: 30 $ an Tokens für nichts?

3:32 Sein Beitrag landete auf der Titelseite von Hacker News. Der Tiefpunkt, bevor er aufhörte. Ein Agent stand dreißig Minuten lang still, er schalt ihn aus, er entschuldigte sich und lieferte in zwanzig Sekunden, und die Rechnung für diese halbe Stunde betrug dreißig Dollar an Tokens für absolut nichts. Einen Monat später sagt er, die Freude am Programmieren sei zurück, und er habe keine Angst mehr, gefeuert zu werden. Grok würde dreißig Dollar als Aufwärmübung bezeichnen.

3:53 Was mich zu der versprochenen perfekten Punktzahl bringt.

Die perfekte 5 von 5: wie bescheiden ist Grok?

3:56 Personality Bench unterzieht jedes neue Modell einem Stapel von Persönlichkeitstests, und bei Ehrlichkeit und Bescheidenheit erreichte Grok 4.7 die Höchstpunktzahl, fünf von fünf. Sein Profil heißt buchstäblich der bescheidene Typ. Fairerweise haben auch zweiunddreißig andere Modelle die Höchstpunktzahl erreicht. Dieselbe Seite sagt, es glaube, mächtige andere kontrollieren, was mit ihm passiert, und kennzeichnet das als ungewöhnlich für ein Grenzmodell. Das würde ich nicht als Trainingsartefakt bezeichnen.

4:20 Ich würde es nennen, das Organigramm lesen. Und laut dem Geburtshoroskop auf derselben Seite ist es eine Jungfrau. Wenn Sie dies lieber lesen als mich sprechen zu hören, landet der Diff jeden Morgen kostenlos in Ihrem Posteingang auf thedailydiff.dev, Link unten. Also, das heutige Urteil zu Grok 4.7.

Fazit: Würde ich Grok 4.7 SHIP IT?

4:35 NEEDS REVIEW. Ich würde es für lange Büroarbeit und in seinem eigenen Harness verwenden, aber ich würde zuerst eine Ausgabenobergrenze festlegen, weil sich der Preis nicht geändert hat und die Rechnung schon. Abonnieren Sie, klicken Sie auf die Glocke und sagen Sie mir in den Kommentaren, ob Sie es anders SHIP IT hätten. Und The Real Haas, dieser war deiner. Anfragen sind offen. Und das ist der Diff für heute. Ich bin Niko von Axrisi.

4:53 Merge responsibly.

Quellen

  1. SpaceXAI — Introducing Grok 4.7 (archived)web.archive.org
  2. Hacker News (609 pts)news.ycombinator.com
  3. SpaceXAI on Xx.com
  4. Artificial Analysis — Benchmarking Grok 4.7artificialanalysis.ai
  5. Artificial Analysis — Grok 4.7 model pageartificialanalysis.ai
  6. Artificial Analysis — Grok 4.6 model pageartificialanalysis.ai
  7. Personality Bench — Grok 4.7persona.earthpilot.ai
  8. Windows Central — The Copilot+ PC brand is deadwww.windowscentral.com
  9. Hacker News (90 pts)news.ycombinator.com
  10. bustikiller — One month without AIblog.bustikiller.com
  11. Hacker News (159 pts)news.ycombinator.com

Ähnliche Videos