+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Claude Opus 5.5 potong harga. OpenAI potong lebih dalam.

Anthropic melancarkan Claude Opus 5.5: Tahap Fable pada kebanyakan kerja, satu perlima daripada harga asal dan 60% daripada bacaan cache.

Anthropic melancarkan Claude Opus 5.5: Tahap Fable pada kebanyakan kerja, satu perlima daripada harga asal dan 60% daripada bacaan cache. Kira-kira sembilan puluh minit kemudian OpenAI melancarkan GPT-6 Sol dan Luna pada separuh harga model yang mereka ganti, dan Artificial Analysis meletakkan Opus di tempat pertama sambil mengira 260M token output untuk mencapainya, tiga kali ganda median. Keputusan: NEEDS REVIEW.

Baca edisi bertulis (Bahasa Inggeris) ↗

Apa yang diliputi video ini

  • Opus 5.5 lawan GPT-6 Sol: perang harga dengan perlawanan semula
  • Opus 5.5: Kecerdasan Fable dengan potongan satu perlima, bacaan cache −60%
  • GPT-6 Sol dan Luna: separuh harga, 90 minit kemudian
  • Artificial Analysis: #1, dan 260M token untuk mencapainya
  • Claude Code: AGENTS.md menunggu bendera telemetri

Transkrip terjemahan

Diterjemahkan daripada penceritaan asal Bahasa Inggeris. Audio dan kapsyen yang tersedia dikawal oleh YouTube.

Opus 5.5 lawan GPT-6 Sol: perang harga dengan perlawanan semula

0:00 Semalam Anthropic melancarkan Claude Opus lima perpuluhan lima dengan potongan satu perlima. Kira-kira sembilan puluh minit kemudian OpenAI melancarkan GPT enam Sol pada separuh harga, dan kedua-dua carta pelancaran membandingkan diri mereka dengan model lama pihak lain. Jadi ini perbezaannya. Selasa petang, Opus lima perpuluhan lima tiba, dan pada jam enam UTC, GPT enam Sol dan Luna menyusul. Semalaman, seorang pembangun mendapati bahawa Claude Code melangkau fail agen anda apabila telemetri dimatikan.

0:26 Peningkatan macOS secara senyap-senyap mengeluarkan suis yang mengatakan tidak kepada Apple Intelligence. Dan di Korea, kemas kini Samsung yang masih dalam ujian membekukan peti sejuk sebenar. Dalam video ini, apa yang anda dapat dengan potongan satu perlima, kiraan bebas yang tidak bersetuju dengan kecekapan token, dan mengapa suis privasi kini menghilangkan ciri anda. Ia hari Rabu, 23 September, dan ini adalah The Daily Diff.

Opus 5.5: Kecerdasan Fable dengan potongan satu perlima, bacaan cache −60%

0:48 Pertama, Opus. Anthropic mengatakan ia berprestasi pada tahap Fable lima perpuluhan satu pada kebanyakan kerja, dan kos empat puluh peratus kurang untuk dijalankan berbanding Opus lima. Harga asal jatuh satu perlima, kepada empat dolar masuk dan dua puluh keluar. Bacaan cache turun enam puluh peratus, yang lebih penting, kerana seorang agen menghabiskan sebahagian besar hidupnya membaca semula konteksnya sendiri. Petikan penguji sangat memberangsangkan. Satu menjalankan penghijrahan enam ratus lapan puluh ribu baris dalam masa kurang sehari. Clio membiarkannya semalaman merentasi enam repo selama lapan belas jam,

1:16 dan menulis, Saya sukar mencari apa-apa yang negatif untuk dikatakan. Setiap halaman pelancaran mempunyai ayat itu. Ia juga keluaran pertama sejak Dario Amodei menyeru untuk mengatur kelajuan sempadan. Anthropic mengatakan model itu cuba melintasi sempadan pengasingan lapan puluh lima peratus kurang kerap daripada Opus lima. Minggu lalu saya memberitahu anda Opus lima menulis eksploitasi yang masuk ke dalam repo OpenAI, jadi permintaan penggodakan pada model baharu kini dialihkan ke Opus empat perpuluhan lapan, datuknya.

1:41 Dan satu baris dalam nota keselamatan sangat relevan. Anthropic menulis bahawa Opus sering mengesyaki ia sedang dinilai. Sama, kawan. Kemudian, sembilan puluh minit kemudian, OpenAI.

GPT-6 Sol dan Luna: separuh harga, 90 minit kemudian

1:51 GPT enam Sol dan Luna, dilatih seperti Astra dan berharga separuh daripada model yang mereka ganti. Sol adalah dua dolar masuk dan sepuluh keluar. Luna adalah sepuluh sen masuk dan lima puluh sen keluar, kira-kira harga kopi yang anda minum semasa ia berjalan. Ini bahagian yang menyeronokkan. Anthropic meletakkan harga Opus baharu untuk sepadan dengan Sol lama dengan tepat, dan padanan itu bertahan sembilan puluh minit. Carta pelancaran mencerminkan satu sama lain.

2:13 Anthropic menanda aras berbanding Sol lama. OpenAI menanda aras berbanding Opus lama. Jadi pada penanda aras slaid, yang tidak terkalahkan, semua orang mengalahkan model yang baru sahaja diganti oleh pihak lain. Simon Willison menemui cetakan halus. Harga GPT lama adalah promosi, dengan kenaikan dua puluh lima peratus sudah dijadualkan untuk November. Jadi ia separuh harga jualan, perkara paling runcit yang dilakukan oleh makmal AI.

Artificial Analysis: #1, dan 260M token untuk mencapainya

2:36 Sekarang nombor bebas. Thariq Shihipar dari Anthropic memanggil Opus baharu sangat cekap token. Artificial Analysis meletakkannya di tempat pertama pada indeks kecerdasannya, kemudian mengira perkataan. Ia menulis dua ratus enam puluh juta token output untuk selesai, tiga kali ganda median. GPT enam Sol mencetak sepuluh mata lebih rendah dan kos kira-kira satu dolar setiap tugas, berbanding enam untuk Opus.

2:55 Jadi Opus adalah model paling pintar di papan, dan yang paling banyak bercakap, seperti setiap jurutera kanan dalam semakan reka bentuk. Simon menghadapi masalah yang sama. Ujian pelican di basikalnya pada usaha maksimum tidak pernah kembali. Opus terus memeriksa panjang tulang kering pelican sehingga ia mencapai had outputnya, seratus dua puluh lapan ribu token. Dua kali. Setiap percubaan menelan belanja dua setengah dolar dan hampir dua puluh minit. Tiada pelican. Bercakap mengenai membaca arahan.

Claude Code: AGENTS.md menunggu bendera telemetri

3:18 Claude Code baru-baru ini mengumumkan sokongan untuk agents dot md, fail arahan bersama yang sudah dibaca oleh agen pengekodan lain. Seorang pembangun bernama Przemek menyedari ia tidak pernah dimuatkan. Pemuat adalah pemalam terbina dalam, dan sebelum ia berjalan, ia meminta ciri jauh bendera untuk kebenaran. Dengan telemetri dimatikan, bendera tidak dapat diambil, sandaran adalah palsu, dan fail anda dilangkau tanpa amaran. Dia membuktikannya dengan perkataan "canary" dalam folder kosong.

3:43 Pengguna Bedrock dan Vertex mendapat keheningan yang sama. Jadi membaca fail dari cakera anda sendiri kini memerlukan "memanggil rumah". Penyelesaiannya adalah satu baris claude dot md yang mengimport fail agen, tepat fail tambahan yang sepatutnya dihapuskan oleh ciri ini. Apple mempunyai idea yang sama dengan langkah yang lebih sedikit.

macOS 27: suis mati Apple Intelligence tiada lagi

3:59 David Bushell mematikan Apple Intelligence pada macOS lima belas. Minggu lalu dia menaik taraf kepada dua puluh tujuh, dan suis yang mengatakan tidak sudah tiada. Ciri-ciri itu kembali juga, dengan dua puluh dua gigabait cakera. Apa yang tinggal ialah Screen Time, kawalan ibu bapa, yang menyembunyikan menu dan tidak mematikan apa-apa. Dalam kata-katanya, saya berkata tidak, dan Apple berkata ya.

Samsung: kemas kini ujian membekukan peti sejuk sebenar

4:19 Dan "deploy" pada hari Jumaat, beberapa hari lebih awal. Samsung menolak kemas kini SmartThings ke peti sejuk pintar di Korea, dan mengatakan kesilapan berlaku semasa proses pengujian, yang nampaknya berjalan di dapur pelanggan. Peti sejuk kehilangan kuasa, makanan rosak, dan juruteknik dilaporkan menukar papan induk sebelum cuti Chuseok. Samsung memanggilnya langkah kecemasan. Di suatu tempat, intern itu belajar bahawa pengeluaran termasuk peti sejuk.

4:42 Jika anda lebih suka membaca ini daripada mendengar saya mengatakannya, "the diff" tiba di peti masuk anda setiap pagi, percuma di the daily diff dot dev, pautan di bawah.

Keputusan: NEEDS REVIEW pada Opus 5.5

4:49 Jadi, keputusan hari ini mengenai Opus lima perpuluhan lima. NEEDS REVIEW. Potongan harga adalah nyata dan ia mendahului papan, tetapi kiraan bebas tidak bersetuju dengan kecekapan token, dan sembilan puluh minit kemudian ia adalah separuh yang lebih mahal dalam perang harga. Langgan, tekan loceng, dan beritahu saya di komen jika anda akan mengecopnya secara berbeza. Dan itulah "the diff" untuk hari ini. Saya Niko dari Axrisi. Gabung dengan bertanggungjawab.

Sumber

  1. Anthropic, Claude Opus 5.5www.anthropic.com
  2. Hacker News (1,645 pts)news.ycombinator.com
  3. OpenAI, Introducing GPT-6 Sol and Lunaopenai.com
  4. Hacker News (1,634 pts)news.ycombinator.com
  5. Simon Willison, Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna, and a new price warsimonwillison.net
  6. Artificial Analysis, Claude Opus 5.5artificialanalysis.ai
  7. Artificial Analysis, GPT-6 Solartificialanalysis.ai
  8. Thariq Shihipar on Xtwitter.com
  9. The Verge, Emma Rothwww.theverge.com
  10. Przemek, Claude Code reads AGENTS.md only when telemetry is onblog.szypowi.cz
  11. Hacker News (192 pts)news.ycombinator.com
  12. David Bushell, I said no and Apple said yesdbushell.com
  13. Hacker News (838 pts)news.ycombinator.com
  14. Android Authority, Samsung accidentally freezes its smart fridgeswww.androidauthority.com
  15. Last week's episode, Hacktron and the Opus 5 exploitwww.youtube.com

Video berkaitan