+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Grok 4.7 costa el mateix, però factura el doble

Grok 4.7 costa exactament el mateix per testimoni que Grok 4.6, 2 $ d'entrada i 6 $ de sortida.

Grok 4.7 costa exactament el mateix per testimoni que Grok 4.6, 2 $ d'entrada i 6 $ de sortida. Llavors, per què la factura independent per tasca es va duplicar, i és realment "el doble de ràpid"? Un seguiment una setmana després. Sol·licitat per @therealhaas. Veredicte: NEEDS REVIEW.

Llegeix l'edició escrita (anglès) ↗

Què cobreix aquest vídeo

  • Mateix preu, el doble de factura?
  • Per què 2 $ / 6 $ ara costa 3,74 $ per tasca?
  • El doble de ràpid? El rellotge diu 57 testimonis per segon
  • Mandrós o treballador? 81.000 testimonis per tasca
  • On ha anat el Copilot+ PC?

Transcripció traduïda

Traduït de la narració original en anglès. L'àudio i els subtítols disponibles estan controlats per YouTube.

Mateix preu, el doble de factura?

0:00 Pensaries que el mateix preu significa la mateixa factura. Dilluns us vaig dir que Grok quatre punt set costa exactament el mateix que Grok quatre punt sis. Per testimoni, sí. Per tasca, costa el doble. En aquest vídeo, tres preguntes. Per què el mateix preu costa el doble? És realment el doble de ràpid, com diu la publicació de llançament? I és el model més mandrós o el més treballador?

0:20 A més, aquest és per encàrrec. The real Haas va preguntar sota el vídeo de divendres, pots fer un vídeo sobre Grok quatre punt set, dos punts D. Vam respondre, molt fàcil, més tard avui. Quan vegis això, probablement ja serà demà, així que el vam enviar tard. Relaxa't, Grok també ho va fer, amb unes dues setmanes de retard, si et creus Hacker News. I una prova va donar a Grok un perfecte cinc de cinc. És el meu número preferit de la setmana, i hi arribaré al final.

0:44 És dissabte, 26 de setembre, i aquest és The Daily Diff.

Per què 2 $ / 6 $ ara costa 3,74 $ per tasca?

0:48 Aquí teniu el truc. El preu per testimoni no es va moure, dos dòlars d'entrada i sis de sortida, per milió. El que es va moure és quant parla. Artificial Analysis va executar tot el seu conjunt de proves, i Grok quatre punt set va escriure uns dos-cents quaranta milions de testimonis. Això és dues vegades i mitja el seu predecessor, i gairebé tres vegades un model típic. Així que el cost mitjà per tasca va passar d'aproximadament un dòlar vuitanta-sis a tres

1:10 setanta-quatre. Mateix preu, el doble de rebut. És un taxi amb la mateixa tarifa per milla que agafa la ruta panoràmica a través de dues altres ciutats. Hacker News ho va detectar en la primera hora. El fil més gran sota el llançament diu un quaranta per cent més de pesos, mateix preu, i gairebé dues setmanes de retard, així que a xAI no li devien agradar els resultats. Un altre comentarista va preguntar sobre el gràfic superior, que compara amb GPT cinc punt sis i silenciósament omet Astra. Això, va escriure, no pot haver estat un descuit.

1:39 Ara, la publicació de llançament.

El doble de ràpid? El rellotge diu 57 testimonis per segon

1:41 El titular diu el doble de ràpid, a la meitat de preu que models comparables. Poques línies més avall, diu servit al mateix preu i velocitat que Grok quatre punt sis. Així que és el doble de ràpid que el model d'una altra persona. Artificial Analysis el va cronometrar a uns cinquanta-set testimonis per segon, més lent que l'antic Grok, i ho va resumir en dues paraules. Notablement lent. Mentrestant, el compte propi de xAI, que ara es diu SpaceX AI, va publicar la versió més tranquil·la. Una millora notable respecte a Grok quatre punt sis, al mateix preu i velocitat.

2:12 Vint-i-vuit mil m'agrada. Així que el tuit i el titular del blog no estan d'acord, i per una vegada el tuit és el cautelós. La qual cosa ens porta a la part més estranya.

Mandrós o treballador? 81.000 testimonis per tasca

2:20 Artificial Analysis diu que treballa més que l'últim Grok, uns vuitanta-un mil testimonis de sortida per tasca, més del doble que l'anterior. I en treballs d'oficina llargs i en el seu propi arnès de codificació, realment va millorar. Ara és el quart entre els agents de codificació, darrere de dos Claudes i GPT sis Astra, i això posa a xAI entre els quatre primers laboratoris. Les persones que l'utilitzen descriuen un model diferent. Un comentarista de Hacker News diu que Grok acaba les tasques gairebé immediatament i afirma

2:46 fet, i el qualifica de ser el més mandrós de tots. Un altre el va veure en bucle en mode de pensament, des de la correcció un fins a la correcció vuitanta-un. Així que és mandrós i verbós al mateix temps. És el company de feina que escriu un pla de vuitanta-un passos, després diu fet i se'n va a casa.

On ha anat el Copilot+ PC?

3:01 Una diferència més directa abans del número divertit. Microsoft ha retirat silenciosament la marca Copilot plus PC. El cap de Surface va dir a Windows Central que els nous Surface PC no s'anomenen Copilot plus PC, tot i que compleixen tots els requisits. Dos anys després d'un llançament la característica principal del qual, Recall, va haver de ser endarrerida per seguretat, el nom només viu a les fulles d'especificacions. La pròpia opinió de Windows Central és més breu. Aquests PC no tenen res a veure amb Copilot.

3:28 I un desenvolupador va provar el contrari de Grok, un mes amb zero IA.

Un mes amb zero IA: 30 $ en testimonis per res?

3:32 La seva publicació va arribar a la pàgina principal de Hacker News. El punt baix abans de renunciar. Un agent es va quedar aturat durant trenta minuts, el va renyar, es va disculpar i va lliurar en vint segons, i la factura per aquella mitja hora va ser de trenta dòlars en testimonis per absolutament res. Un mes després diu que la joia de la programació ha tornat, i no té por de ser acomiadat. Grok consideraria trenta dòlars un escalfament.

3:53 La qual cosa em porta a la puntuació perfecta que vaig prometre.

El perfecte 5 de 5: com d'humil és Grok?

3:56 Personality Bench executa cada nou model a través d'una pila de proves de personalitat, i en honestedat i humilitat, Grok quatre punt set va obtenir la màxima puntuació, cinc de cinc. El seu perfil es diu literalment el tipus humil. Per ser justos, trenta-dos altres models també van obtenir la màxima puntuació. La mateixa pàgina diu que creu que altres poderosos controlen el que li passa, i ho assenyala com a inusual per a un model de frontera. Jo no ho diria un artefacte d'entrenament.

4:20 Jo ho diria llegir l'organigrama. I segons la carta natal de la mateixa pàgina, és verge. Si prefereixes llegir això que sentir-me dir-ho, la diferència arriba a la teva safata d'entrada cada matí, gratis a the daily diff dot dev, enllaç a sota. Així doncs, el veredicte d'avui sobre Grok quatre punt set.

Veredicte: enviaria Grok 4.7?

4:35 NEEDS REVIEW. El faria servir per a treballs d'oficina llargs i dins del seu propi arnès, però primer li posaria un límit de despesa, perquè el preu no va canviar i la factura sí. Subscriu-te, prem la campana i digues-me als comentaris si l'hauries segellat de manera diferent. I the real Haas, aquest era teu. Les sol·licituds estan obertes. I aquesta és la diferència d'avui. Sóc Niko d'Axrisi.

4:53 Fusiona amb responsabilitat.

Fonts

  1. SpaceXAI — Introducing Grok 4.7 (archived)web.archive.org
  2. Hacker News (609 pts)news.ycombinator.com
  3. SpaceXAI on Xx.com
  4. Artificial Analysis — Benchmarking Grok 4.7artificialanalysis.ai
  5. Artificial Analysis — Grok 4.7 model pageartificialanalysis.ai
  6. Artificial Analysis — Grok 4.6 model pageartificialanalysis.ai
  7. Personality Bench — Grok 4.7persona.earthpilot.ai
  8. Windows Central — The Copilot+ PC brand is deadwww.windowscentral.com
  9. Hacker News (90 pts)news.ycombinator.com
  10. bustikiller — One month without AIblog.bustikiller.com
  11. Hacker News (159 pts)news.ycombinator.com

Vídeos relacionats