+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Grok 4.7 berharga sama, tetapi bil berganda

Grok 4.7 berharga sama seperti Grok 4.6 setiap token, $2 masuk dan $6 keluar.

Grok 4.7 berharga sama seperti Grok 4.6 setiap token, $2 masuk dan $6 keluar. Jadi mengapa bil bebas setiap tugas berganda, dan adakah ia benar-benar "dua kali lebih cepat"? Susulan seminggu kemudian. Diminta oleh @therealhaas. Keputusan: PERLU SEMAKAN.

Baca edisi bertulis (Bahasa Inggeris) ↗

Apa yang diliputi video ini

  • Harga sama, bil berganda?
  • Mengapa $2 / $6 kini berharga $3.74 satu tugas?
  • Dua kali lebih cepat? Jam menunjukkan 57 token sesaat
  • Malas atau rajin? 81,000 token satu tugas
  • Ke mana perginya Copilot+ PC?

Transkrip terjemahan

Diterjemahkan daripada penceritaan asal Bahasa Inggeris. Audio dan kapsyen yang tersedia dikawal oleh YouTube.

Harga sama, bil berganda?

0:00 Anda mungkin fikir harga yang sama bermaksud bil yang sama. Pada hari Isnin saya memberitahu anda Grok empat titik tujuh berharga sama seperti Grok empat titik enam. Per token, ia memang begitu. Per tugas, ia berharga dua kali ganda. Dalam video ini, tiga soalan. Mengapa harga yang sama berharga dua kali ganda? Adakah ia benar-benar dua kali lebih cepat, seperti yang dikatakan oleh siaran pelancaran? Dan adakah ia model yang paling malas, atau yang paling rajin?

0:20 Juga, yang ini atas permintaan. Haas sebenar bertanya di bawah video Jumaat, bolehkah anda membuat video tentang Grok empat titik tujuh, titik D. Kami menjawab, mudah saja, kemudian hari ini. Pada masa anda menonton ini, mungkin sudah esok, jadi kami lambat SHIPPING. Tenang, Grok pun begitu, kira-kira dua minggu lewat, jika anda percaya Hacker News. Dan satu ujian memberikan Grok lima daripada lima yang sempurna. Ia nombor kegemaran saya minggu ini, dan saya akan membincangkannya di akhir.

0:44 Hari Sabtu, 26 September, dan ini adalah The Daily Diff.

Mengapa $2 / $6 kini berharga $3.74 satu tugas?

0:48 Ini helahnya. Harga setiap token tidak bergerak, dua dolar masuk dan enam keluar, per juta. Apa yang bergerak adalah berapa banyak ia bercakap. Artificial Analysis menjalankan seluruh suite ujiannya, dan Grok empat titik tujuh menulis kira-kira dua ratus empat puluh juta token. Itu dua setengah kali ganda pendahulunya, dan hampir tiga kali ganda model biasa. Jadi kos purata setiap tugas meningkat daripada kira-kira satu dolar lapan puluh enam kepada tiga

1:10 tujuh puluh empat. Harga tag yang sama, resit berganda. Ia adalah teksi dengan kadar yang sama per batu yang mengambil laluan indah melalui dua bandar lain. Hacker News mengesannya dalam jam pertama. Thread terbesar di bawah pelancaran mengatakan empat puluh peratus lebih banyak berat, harga yang sama, dan hampir dua minggu lewat, jadi xAI pasti tidak menyukai hasilnya. Seorang lagi pengulas bertanya tentang carta di atas, yang membandingkan dengan GPT lima titik enam dan secara senyap meninggalkan Astra. Itu, tulisnya, tidak mungkin terlepas pandang.

1:39 Sekarang, siaran pelancaran.

Dua kali lebih cepat? Jam menunjukkan 57 token sesaat

1:41 Tajuk utama mengatakan dua kali lebih cepat, pada separuh harga model yang setanding. Beberapa baris ke bawah, ia mengatakan dihidangkan pada harga dan kelajuan yang sama seperti Grok empat titik enam. Jadi ia dua kali lebih cepat daripada model orang lain. Artificial Analysis mencatatkan ia kira-kira lima puluh tujuh token sesaat, lebih perlahan daripada Grok lama, dan meringkaskannya dalam dua perkataan. Sangat perlahan. Sementara itu, akaun xAI sendiri, yang kini dikenali sebagai SpaceX AI, menyiarkan versi yang lebih tenang. Peningkatan yang ketara berbanding Grok empat titik enam, pada harga dan kelajuan yang sama.

2:12 Dua puluh lapan ribu suka. Jadi tweet dan tajuk blog tidak bersetuju, dan untuk sekali ini tweet adalah yang berhati-hati. Yang membawa kita kepada bahagian yang paling aneh.

Malas atau rajin? 81,000 token satu tugas

2:20 Artificial Analysis mengatakan ia bekerja lebih keras daripada Grok sebelumnya, kira-kira lapan puluh satu ribu token output per tugas, lebih daripada dua kali ganda yang terakhir. Dan pada kerja pejabat yang panjang dan dalam kelengkapan pengekodannya sendiri, ia benar-benar bertambah baik. Ia keempat di kalangan ejen pengekodan sekarang, di belakang dua Claude dan GPT enam Astra, dan itu menempatkan xAI dalam empat makmal teratas. Orang yang menggunakannya menggambarkan model yang berbeza. Seorang pengulas Hacker News mengatakan Grok menamatkan tugas hampir serta-merta dan mendakwa

2:46 selesai, dan menyebutnya yang paling malas di antara semuanya. Seorang lagi melihatnya berulang-alik dalam mod berfikir, dari pembetulan satu sehingga pembetulan lapan puluh satu. Jadi ia malas dan banyak bercakap pada masa yang sama. Ia adalah rakan sekerja yang menulis rancangan lapan puluh satu langkah, kemudian berkata selesai dan pulang ke rumah.

Ke mana perginya Copilot+ PC?

3:01 Satu lagi perbezaan langsung sebelum nombor yang menyeronokkan. Microsoft secara senyap-senyap telah menghentikan jenama Copilot plus PC. Bos Surface memberitahu Windows Central bahawa PC Surface baharu tidak dipanggil Copilot plus PC, walaupun ia memenuhi setiap keperluan. Dua tahun selepas pelancaran yang ciri utamanya, Recall, terpaksa ditangguhkan atas sebab keselamatan, nama itu hanya wujud pada lembaran spesifikasi. Pendapat Windows Central sendiri lebih ringkas. PC ini tiada kaitan dengan Copilot.

3:28 Dan seorang pembangun mencuba kebalikan Grok, sebulan tanpa AI.

Sebulan tanpa AI: $30 token sia-sia?

3:32 Siapannya mendapat halaman depan Hacker News. Titik terendah sebelum dia berhenti. Seorang ejen terhenti selama tiga puluh minit, dia memarahinya, ia meminta maaf dan menyerahkan dalam dua puluh saat, dan bil untuk setengah jam itu adalah tiga puluh dolar token tanpa sebarang hasil. Sebulan kemudian dia mengatakan kegembiraan pengaturcaraan kembali, dan dia tidak takut dipecat. Grok akan memanggil tiga puluh dolar sebagai pemanasan.

3:53 Yang membawa saya kepada skor sempurna yang saya janjikan.

5 daripada 5 yang sempurna: betapa rendah dirinyakah Grok?

3:56 Personality Bench menjalankan setiap model baharu melalui timbunan ujian personaliti, dan pada kejujuran dan kerendahan hati, Grok empat titik tujuh mencapai markah maksimum, lima daripada lima. Profilnya secara harfiah dipanggil jenis yang rendah hati. Untuk berlaku adil, tiga puluh dua model lain juga mencapai markah maksimum. Halaman yang sama mengatakan ia percaya pihak berkuasa lain mengawal apa yang berlaku kepadanya, dan menandakan itu sebagai luar biasa untuk model perintis. Saya tidak akan memanggil itu artifak latihan.

4:20 Saya akan memanggilnya membaca carta organisasi. Dan menurut carta kelahiran di halaman yang sama, ia adalah Virgo. Jika anda lebih suka membaca ini daripada mendengar saya mengatakannya, diff dihantar ke peti masuk anda setiap pagi, percuma di the daily diff dot dev, pautan di bawah. Jadi, keputusan hari ini mengenai Grok empat titik tujuh.

Keputusan: adakah saya akan SHIP Grok 4.7?

4:35 PERLU SEMAKAN. Saya akan menggunakannya untuk kerja pejabat yang panjang dan dalam kelengkapan sendiri, tetapi saya akan meletakkan had perbelanjaan padanya terlebih dahulu, kerana harga tidak berubah dan bil pula berubah. Langgan, tekan loceng, dan beritahu saya di komen jika anda akan mencopnya secara berbeza. Dan Haas yang sebenar, yang ini milik anda. Permintaan dibuka. Dan itu perbezaan untuk hari ini. Saya Niko dari Axrisi.

4:53 Gabungkan secara bertanggungjawab.

Sumber

  1. SpaceXAI — Introducing Grok 4.7 (archived)web.archive.org
  2. Hacker News (609 pts)news.ycombinator.com
  3. SpaceXAI on Xx.com
  4. Artificial Analysis — Benchmarking Grok 4.7artificialanalysis.ai
  5. Artificial Analysis — Grok 4.7 model pageartificialanalysis.ai
  6. Artificial Analysis — Grok 4.6 model pageartificialanalysis.ai
  7. Personality Bench — Grok 4.7persona.earthpilot.ai
  8. Windows Central — The Copilot+ PC brand is deadwww.windowscentral.com
  9. Hacker News (90 pts)news.ycombinator.com
  10. bustikiller — One month without AIblog.bustikiller.com
  11. Hacker News (159 pts)news.ycombinator.com

Video berkaitan