+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Grok 4.7 kost hetzelfde, maar rekent het dubbele

Grok 4.7 kost precies wat Grok 4.6 deed per token, $2 in en $6 uit.

Grok 4.7 kost precies wat Grok 4.6 deed per token, $2 in en $6 uit. Dus waarom verdubbelde de onafhankelijke rekening per taak, en is het echt "twee keer zo snel"? Een follow-up van een week later. Aangevraagd door @therealhaas. Oordeel: NEEDS REVIEW.

Lees de geschreven editie (Engels) ↗

Wat deze video behandelt

  • Zelfde prijs, dubbele rekening?
  • Waarom kost $2 / $6 nu $3,74 per taak?
  • Twee keer zo snel? De klok zegt 57 tokens per seconde
  • Lui of hardwerkend? 81.000 tokens per taak
  • Waar is de Copilot+ pc gebleven?

Vertaald transcript

Vertaald vanuit de originele Engelse gesproken tekst. Beschikbare audio en ondertiteling worden beheerd door YouTube.

Zelfde prijs, dubbele rekening?

0:00 Je zou denken dat dezelfde prijs hetzelfde bedrag betekent. Maandag vertelde ik jullie dat Grok 4.7 precies hetzelfde kost als Grok 4. 6. Per token is dat zo. Per taak kost het het dubbele. In deze video, drie vragen. Waarom kost dezelfde prijs het dubbele? Is het echt twee keer zo snel, zoals de lanceringspost zegt? En is het het luieste model dat er is, of het hardst werkende?

0:20 Deze is ook op verzoek. De echte Haas vroeg onder de video van vrijdag, kun je een video maken over Grok 4. 7, dubbele punt D. We antwoordden, appeltje eitje, later vandaag. Tegen de tijd dat je dit kijkt, is het waarschijnlijk morgen, dus we hebben laat geleverd. Ontspan, Grok deed dat ook, ongeveer twee weken te laat, als je Hacker News moet geloven. En één test gaf Grok een perfecte vijf uit vijf. Het is mijn favoriete nummer van de week, en ik kom er aan het einde op terug.

0:44 Het is zaterdag 26 september, en dit is The Daily Diff.

Waarom kost $2 / $6 nu $3,74 per taak?

0:48 Hier is de truc. De prijs per token is niet veranderd, twee dollar in en zes uit, per miljoen. Wat wel veranderde, is hoeveel het praat. Artificial Analysis voerde zijn hele testsuite uit, en Grok 4.7 schreef ongeveer tweehonderdveertig miljoen tokens. Dat is twee en een half keer zijn voorganger, en bijna drie keer een typisch model. Dus de gemiddelde kosten per taak gingen van ongeveer een dollar zesentachtig naar drie

1:10 vierenzeventig. Hetzelfde prijskaartje, dubbele rekening. Het is een taxi met hetzelfde tarief per mijl die de toeristische route door twee andere steden neemt. Hacker News zag het in het eerste uur. De grootste discussie onder de lancering zegt veertig procent meer gewichten, dezelfde prijs, en bijna twee weken te laat, dus xAI kan de resultaten niet geliefd hebben. Een andere commentator vroeg naar de grafiek bovenaan, die vergelijkt met GPT 5.6 en Astra stilletjes weglaat. Dat, schreef hij, kan geen vergissing zijn geweest.

1:39 Nu, de lanceringspost.

Twee keer zo snel? De klok zegt 57 tokens per seconde

1:41 De kop zegt twee keer zo snel, voor de helft van de prijs van vergelijkbare modellen. Een paar regels lager staat dat het wordt aangeboden tegen dezelfde prijs en snelheid als Grok 4. 6. Dus het is twee keer zo snel als het model van iemand anders. Artificial Analysis klokte het op ongeveer zevenenvijftig tokens per seconde, langzamer dan de oude Grok, en vatte het samen in twee woorden. Opmerkelijk langzaam. Ondertussen plaatste xAI's eigen account, dat nu SpaceX AI heet, de rustigere versie. Een aanzienlijke verbetering ten opzichte van Grok 4.6, voor dezelfde prijs en snelheid.

2:12 Achtentwintigduizend likes. Dus de tweet en de blogkop zijn het oneens, en voor eens is de tweet de voorzichtige. Wat ons bij het vreemdste deel brengt.

Lui of hardwerkend? 81.000 tokens per taak

2:20 Artificial Analysis zegt dat het harder werkt dan de laatste Grok, ongeveer eenentachtigduizend outputtokens per taak, meer dan het dubbele van de vorige. En bij langdurig kantoorwerk en in zijn eigen coderingstoepassing, verbeterde het echt. Het is nu de vierde onder coderingsagenten, achter twee Claudes en GPT 6 Astra, en dat plaatst xAI in de top vier van laboratoria. De mensen die het gebruiken beschrijven een ander model. Een Hacker News-commentator zegt dat Grok taken bijna onmiddellijk beëindigt en beweert

2:46 klaar te zijn, en noemt het de luieste van allemaal. Een ander zag het lussen in denkmodus, van fix één helemaal tot fix eenentachtig. Dus het is lui en spraakzaam tegelijk. Het is de collega die een eenentachtigstappenplan schrijft, dan zegt klaar en naar huis gaat.

Waar is de Copilot+ pc gebleven?

3:01 Nog één directe vergelijking voor het leuke nummer. Microsoft heeft stilletjes het merk Copilot+ PC teruggetrokken. De Surface-baas vertelde Windows Central dat de nieuwe Surface-pc's geen Copilot plus pc's heten, hoewel ze aan elke vereiste voldoen. Twee jaar na een lancering waarvan de hoofdfunctie, Recall, wegens veiligheid moest worden uitgesteld, leeft de naam alleen nog op specificatiebladen. Windows Central's eigen mening is korter. Deze pc's hebben niets met Copilot te maken.

3:28 En één ontwikkelaar probeerde het tegenovergestelde van Grok, een maand zonder AI.

Een maand zonder AI: $30 aan tokens voor niets?

3:32 Zijn post haalde de voorpagina van Hacker News. Het dieptepunt voordat hij stopte. Een agent zat dertig minuten vast, hij sprak hem vermanend toe, het verontschuldigde zich en leverde binnen twintig seconden, en de rekening voor dat half uur was dertig dollar aan tokens voor absoluut niets. Een maand later zegt hij dat de vreugde van het programmeren terug is, en hij niet bang is om ontslagen te worden. Grok zou dertig dollar een warming-up noemen.

3:53 Wat me brengt bij de perfecte score die ik beloofde.

De perfecte 5 uit 5: hoe bescheiden is Grok?

3:56 Personality Bench draait elk nieuw model door een stapel persoonlijkheidstests, en op eerlijkheid en nederigheid scoorde Grok 4.7 maximaal, vijf uit vijf. Zijn profiel wordt letterlijk de bescheiden type genoemd. Om eerlijk te zijn, tweeëndertig andere modellen scoorden ook maximaal. Dezelfde pagina zegt dat het gelooft dat machtige anderen bepalen wat er met het gebeurt, en markeert dat als ongebruikelijk voor een grensmodel. Ik zou dat geen trainingsartefact noemen.

4:20 Ik zou het de organisatiekaart lezen noemen. En volgens de geboortehoroscoop op dezelfde pagina, is het een Maagd. Als je dit liever leest dan mij het hoort zeggen, dan landt de diff elke ochtend in je inbox, gratis op thedailydiff.dev, link hieronder. Dus, het oordeel van vandaag over Grok 4.7.

Oordeel: zou ik Grok 4.7 SHIP IT?

4:35 NEEDS REVIEW. Ik zou het gebruiken voor langdurig kantoorwerk en binnen zijn eigen toepassing, maar ik zou er eerst een uitgavenlimiet op zetten, omdat de prijs niet veranderde en de rekening wel. Abonneer, druk op de bel, en vertel me in de reacties of je het anders had bestempeld. En de echte Haas, deze was van jou. Verzoeken zijn open. En dat is de diff voor vandaag. Ik ben Niko van Axrisi.

4:53 Verantwoord samenvoegen.

Bronnen

  1. SpaceXAI — Introducing Grok 4.7 (archived)web.archive.org
  2. Hacker News (609 pts)news.ycombinator.com
  3. SpaceXAI on Xx.com
  4. Artificial Analysis — Benchmarking Grok 4.7artificialanalysis.ai
  5. Artificial Analysis — Grok 4.7 model pageartificialanalysis.ai
  6. Artificial Analysis — Grok 4.6 model pageartificialanalysis.ai
  7. Personality Bench — Grok 4.7persona.earthpilot.ai
  8. Windows Central — The Copilot+ PC brand is deadwww.windowscentral.com
  9. Hacker News (90 pts)news.ycombinator.com
  10. bustikiller — One month without AIblog.bustikiller.com
  11. Hacker News (159 pts)news.ycombinator.com

Gerelateerde video's