+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Claude Opus 5.5 taglia i prezzi. OpenAI taglia più a fondo.

Anthropic ha lanciato Claude Opus 5.5: livello Fable sulla maggior parte del lavoro, un quinto in meno rispetto al prezzo di listino e il 60% in meno sulle letture memorizzate nella cache.

Anthropic ha lanciato Claude Opus 5.5: livello Fable sulla maggior parte del lavoro, un quinto in meno rispetto al prezzo di listino e il 60% in meno sulle letture memorizzate nella cache. Circa novanta minuti dopo, OpenAI ha lanciato GPT-6 Sol e Luna a metà prezzo rispetto ai modelli che sostituiscono, e Artificial Analysis ha classificato Opus al primo posto mentre contava 260 milioni di token di output per arrivarci, tre volte la mediana. Verdetto: NEEDS REVIEW.

Leggi l'edizione scritta (inglese) ↗

Contenuto di questo video

  • Opus 5.5 vs GPT-6 Sol: una guerra dei prezzi con una rivincita
  • Opus 5.5: cervello Fable con un quinto di sconto, letture cache −60%
  • GPT-6 Sol e Luna: metà prezzo, 90 minuti dopo
  • Artificial Analysis: #1, e 260M token per arrivarci
  • Claude Code: AGENTS.md attende un flag di telemetria

Trascrizione tradotta

Tradotto dalla narrazione originale inglese. L'audio e i sottotitoli disponibili sono controllati da YouTube.

Opus 5.5 vs GPT-6 Sol: una guerra dei prezzi con una rivincita

0:00 Ieri Anthropic ha lanciato Claude Opus cinque punto cinque con un quinto di sconto. Circa novanta minuti dopo OpenAI ha lanciato GPT sei Sol a metà prezzo, ed entrambi i grafici di lancio si confrontano con il vecchio modello dell'altra parte. Ecco la differenza. Martedì pomeriggio, Opus cinque punto cinque arriva, e alle sei UTC, seguono GPT sei Sol e Luna. Durante la notte, uno sviluppatore scopre che Claude Code salta il tuo file agenti quando la telemetria è disattivata.

0:26 Un aggiornamento di macOS ha rimosso silenziosamente l'interruttore che diceva no ad Apple Intelligence. E in Corea, un aggiornamento Samsung ancora in fase di test ha bloccato veri frigoriferi. In questo video, cosa ti compra un quinto di sconto, il conteggio indipendente che non è d'accordo con l'efficienza dei token, e perché un interruttore per la privacy ora ti costa una funzione. È mercoledì 23 settembre, e questo è The Daily Diff.

Opus 5.5: cervello Fable con un quinto di sconto, letture cache −60%

0:48 Primo, Opus. Anthropic dice che si comporta al livello di Fable cinque punto uno sulla maggior parte del lavoro, e costa il quaranta percento in meno rispetto a Opus cinque. Il prezzo di listino scende di un quinto, a quattro dollari in entrata e venti in uscita. Le letture memorizzate nella cache diminuiscono del sessanta percento, il che è più importante, perché un agente trascorre la maggior parte della sua vita a rileggere il proprio contesto. Le citazioni dei tester sono entusiastiche. Uno ha eseguito una migrazione di seicentottantamila righe in meno di un giorno. Clio l'ha lasciato da solo per tutta la notte su sei repo per diciotto ore,

1:16 e ha scritto, faccio fatica a trovare qualcosa di negativo da dire. Ogni pagina di lancio ha quella frase. È anche la prima release da quando Dario Amodei ha chiesto di "pacing the frontier" (ritmare la frontiera). Anthropic dice che il modello ha tentato di superare i confini di contenimento l'ottantacinque percento in meno rispetto a Opus cinque. La settimana scorsa ti ho detto che Opus cinque ha scritto l'exploit che è entrato nei repo di OpenAI, quindi le richieste di hacking sul nuovo modello vengono ora reindirizzate a Opus quattro punto otto, il suo antenato.

1:41 E una riga nelle note di sicurezza è molto pertinente. Anthropic scrive che Opus spesso sospetta di essere valutato. Idem, amico. Poi, novanta minuti dopo, OpenAI.

GPT-6 Sol e Luna: metà prezzo, 90 minuti dopo

1:51 GPT sei Sol e Luna, addestrati come Astra e con un prezzo pari alla metà dei modelli che sostituiscono. Sol costa due dollari in entrata e dieci in uscita. Luna costa dieci centesimi in entrata e cinquanta centesimi in uscita, all'incirca il prezzo del caffè che bevi mentre funziona. Ecco la parte divertente. Anthropic ha prezzato il nuovo Opus per eguagliare esattamente il vecchio Sol, e quell'uguaglianza è durata novanta minuti. I grafici di lancio si rispecchiano a vicenda.

2:13 Anthropic fa benchmark contro il vecchio Sol. OpenAI fa benchmark contro il vecchio Opus. Quindi sui benchmark delle slide, che sono imbattuti, tutti battono un modello che l'altra parte ha appena sostituito. Simon Willison ha trovato la clausola in piccolo. I vecchi prezzi di GPT erano promozionali, con un aumento del venticinque percento già programmato per novembre. Quindi è la metà del prezzo di vendita, la cosa più da "retail" che un laboratorio di IA abbia mai fatto.

Artificial Analysis: #1, e 260M token per arrivarci

2:36 Ora i numeri indipendenti. Thariq Shihipar di Anthropic definisce il nuovo Opus molto "token efficient". Artificial Analysis lo classifica al primo posto nel suo indice di intelligenza, poi conta le parole. Ha scritto duecentosessanta milioni di token di output per finire, tre volte la mediana. GPT sei Sol ha ottenuto dieci punti in meno e costa circa un dollaro per attività, contro sei per Opus.

2:55 Quindi Opus è il modello più intelligente in circolazione, e quello che parla di più, come ogni ingegnere senior in una revisione di progetto. Simon ha colpito lo stesso muro. Il suo test del pellicano in bicicletta con il massimo sforzo non è mai tornato. Opus ha continuato a controllare la lunghezza degli stinchi del pellicano fino a quando non ha raggiunto il suo limite di output, centoventottomila token. Due volte. Ogni tentativo è costato due dollari e mezzo e quasi venti minuti. Nessun pellicano. Parlando di leggere le istruzioni.

Claude Code: AGENTS.md attende un flag di telemetria

3:18 Claude Code ha recentemente annunciato il supporto per agents.md, il file di istruzioni condiviso che altri agenti di codifica già leggono. Uno sviluppatore di nome Przemek ha notato che non si caricava mai. Il caricatore è un plugin integrato, e prima di essere eseguito, chiede un flag di funzionalità remoto per il permesso. Con la telemetria disattivata, il flag non può essere recuperato, il fallback è falso, e il tuo file viene saltato senza avviso. Lo ha dimostrato con una parola "canary" in una cartella vuota.

3:43 Gli utenti Bedrock e Vertex ottengono lo stesso silenzio. Quindi leggere un file dal tuo disco ora richiede di "chiamare casa". La soluzione è un claude.md di una riga che importa il file agents, esattamente il file extra che questa funzione intendeva rimuovere. Apple ha la stessa idea con meno passaggi.

macOS 27: l'interruttore di disattivazione di Apple Intelligence è sparito

3:59 David Bushell ha disattivato Apple Intelligence su macOS quindici. La settimana scorsa ha aggiornato a ventisette, e l'interruttore che diceva no è sparito. Le funzionalità sono comunque tornate, con ventidue gigabyte di disco. Ciò che rimane è Screen Time, i controlli parentali, che nasconde i menu e non disattiva nulla. Nelle sue parole, ho detto di no, e Apple ha detto di sì.

Samsung: un aggiornamento di prova ha bloccato veri frigoriferi

4:19 E un "deploy" di venerdì, con qualche giorno di anticipo. Samsung ha spinto un aggiornamento SmartThings ai frigoriferi intelligenti in Corea, e dice che l'errore è avvenuto durante il processo di test, che apparentemente si svolge nelle cucine dei clienti. I frigoriferi hanno perso corrente, il cibo è andato a male, e i tecnici, a quanto si dice, stanno sostituendo le schede madri prima della festa di Chuseok. Samsung la chiama misure di emergenza. Da qualche parte, lo stagista sta imparando che la produzione include i frigoriferi.

4:42 Se preferisci leggere questo piuttosto che sentirmi dirlo, la differenza arriva nella tua casella di posta ogni mattina, gratuitamente su thedailydiff.dev, link qui sotto.

Verdetto: NEEDS REVIEW su Opus 5.5

4:49 Quindi, il verdetto di oggi su Opus cinque punto cinque. NEEDS REVIEW. Il taglio di prezzo è reale e si posiziona in cima alla classifica, ma il conteggio indipendente non è d'accordo con l'efficienza dei token, e novanta minuti dopo era la metà più costosa di una guerra dei prezzi. Iscriviti, premi la campanella e dimmi nei commenti se l'avresti stampato diversamente. E questa è la differenza per oggi. Sono Niko di Axrisi. Fai la fusione (merge) in modo responsabile.

Fonti

  1. Anthropic, Claude Opus 5.5www.anthropic.com
  2. Hacker News (1,645 pts)news.ycombinator.com
  3. OpenAI, Introducing GPT-6 Sol and Lunaopenai.com
  4. Hacker News (1,634 pts)news.ycombinator.com
  5. Simon Willison, Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna, and a new price warsimonwillison.net
  6. Artificial Analysis, Claude Opus 5.5artificialanalysis.ai
  7. Artificial Analysis, GPT-6 Solartificialanalysis.ai
  8. Thariq Shihipar on Xtwitter.com
  9. The Verge, Emma Rothwww.theverge.com
  10. Przemek, Claude Code reads AGENTS.md only when telemetry is onblog.szypowi.cz
  11. Hacker News (192 pts)news.ycombinator.com
  12. David Bushell, I said no and Apple said yesdbushell.com
  13. Hacker News (838 pts)news.ycombinator.com
  14. Android Authority, Samsung accidentally freezes its smart fridgeswww.androidauthority.com
  15. Last week's episode, Hacktron and the Opus 5 exploitwww.youtube.com

Video correlati