+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Claude Opus 5.5 kuttet prisene. OpenAI kuttet dypere.

Anthropic lanserte Claude Opus 5.5: Fabel-nivå på det meste av arbeid, en femtedel av fullpris og 60 % rabatt på bufret lesing.

Anthropic lanserte Claude Opus 5.5: Fabel-nivå på det meste av arbeid, en femtedel av fullpris og 60 % rabatt på bufret lesing. Omtrent nitti minutter senere lanserte OpenAI GPT-6 Sol og Luna til halve prisen av modellene de erstatter, og Artificial Analysis rangerte Opus først mens de telte 260M utdata-tokens for å komme dit, tre ganger medianen. Dom: NEEDS REVIEW.

Les den skriftlige utgaven (engelsk) ↗

Hva denne videoen dekker

  • Opus 5.5 vs GPT-6 Sol: en priskrig med omkamp
  • Opus 5.5: Fabel-hjerner med en femtedel rabatt, bufret lesing −60 %
  • GPT-6 Sol og Luna: halv pris, 90 minutter senere
  • Artificial Analysis: #1, og 260M tokens for å komme dit
  • Claude Code: AGENTS.md venter på et telemetri-flagg

Oversatt transkripsjon

Oversatt fra den originale engelske fortellingen. Tilgjengelig lyd og undertekster kontrolleres av YouTube.

Opus 5.5 vs GPT-6 Sol: en priskrig med omkamp

0:00 I går lanserte Anthropic Claude Opus 5.5 med en femtedel rabatt. Omtrent nitti minutter senere lanserte OpenAI GPT 6 Sol til halv pris, og begge lanseringskartene sammenligner seg med den andre sidens gamle modell. Så her er forskjellen. Tirsdag ettermiddag, Opus 5.5 lander, og klokken 6 UTC, GPT 6 Sol og Luna følger etter. Over natten finner en utvikler ut at Claude Code hopper over agents-filen din når telemetri er deaktivert.

0:26 En macOS-oppgradering fjernet stille bryteren som sa nei til Apple Intelligence. Og i Korea frøs en Samsung-oppdatering som fortsatt var under testing, ekte kjøleskap. I denne videoen, hva en femtedel rabatt gir deg, den uavhengige tellingen som er uenig med token-effektiv, og hvorfor en personvernbryter nå koster deg en funksjon. Det er onsdag 23. september, og dette er The Daily Diff.

Opus 5.5: Fabel-hjerner med en femtedel rabatt, bufret lesing −60 %

0:48 Først, Opus. Anthropic sier den yter på nivå med Fable 5.1 på det meste av arbeid, og koster førti prosent mindre å kjøre enn Opus 5. Fullprisen faller en femtedel, til fire dollar inn og tjue ut. Bufret lesing faller seksti prosent, noe som betyr mer, fordi en agent tilbringer mesteparten av livet sitt med å lese sin egen kontekst på nytt. Testersitatene er glødende. En kjørte en migrering på 680 000 linjer på under en dag. Clio lot den være i fred over natten over seks repos i atten timer,

1:16 og skrev, Jeg sliter med å finne noe negativt å si. Hver lanseringsside har den setningen. Det er også den første utgivelsen siden Dario Amodei ba om å tempoe grensen. Anthropic sier modellen forsøkte å krysse innkapslingsgrenser åttifem prosent sjeldnere enn Opus 5. Forrige uke fortalte jeg deg at Opus 5 skrev utnyttelsen som gikk inn i OpenAIs repos, så hackingforespørsler på den nye modellen blir nå omdirigert til Opus 4 punkt åtte, dens bestefar.

1:41 Og en linje i sikkerhetsnotatene er veldig gjenkjennelig. Anthropic skriver at Opus ofte mistenker at den blir evaluert. Samme her, kamerat. Deretter, nitti minutter senere, OpenAI.

GPT-6 Sol og Luna: halv pris, 90 minutter senere

1:51 GPT 6 Sol og Luna, trent som Astra og priset til halvparten av modellene de erstatter. Sol er to dollar inn og ti ut. Luna er ti cent inn og femti cent ut, omtrent prisen på kaffen du drikker mens den kjører. Her er den morsomme delen. Anthropic priset den nye Opus til å matche den gamle Sol nøyaktig, og den matchen varte i nitti minutter. Lanseringskartene speiler hverandre.

2:13 Anthropic sammenligner med den gamle Sol. OpenAI sammenligner med den gamle Opus. Så på presentasjons-sammenligningene, som er uslåelige, slår alle en modell den andre siden nettopp har erstattet. Simon Willison fant den lille skriften. De gamle GPT-prisene var kampanjepriser, med en tjuefem prosent økning allerede planlagt for november. Så det er halv pris av salgsprisen, det mest detaljhandel-aktige et AI-laboratorium har gjort.

Artificial Analysis: #1, og 260M tokens for å komme dit

2:36 Nå de uavhengige tallene. Anthropics Thariq Shihipar kaller den nye Opus veldig token-effektiv. Artificial Analysis rangerer den først på sin intelligensindeks, deretter teller den ordene. Den skrev 260 millioner utdata-tokens for å fullføre, tre ganger medianen. GPT 6 Sol scoret ti poeng lavere og kostet omtrent en dollar per oppgave, mot seks for Opus.

2:55 Så Opus er den smarteste modellen på tavlen, og den som snakker mest, som enhver senioringeniør i en designgjennomgang. Simon traff den samme veggen. Hans pelikan på sykkel-test med maksimal innsats kom aldri tilbake. Opus fortsatte å sjekke pelikanens skinnbenlengde til den nådde sin utdata-grense, hundre og tjueåtte tusen tokens. To ganger. Hvert forsøk kostet to og en halv dollar og nesten tjue minutter. Ingen pelikan. Apropos å lese instruksjoner.

Claude Code: AGENTS.md venter på et telemetri-flagg

3:18 Claude Code annonserte nylig støtte for agents.md, den delte instruksjonsfilen andre kodeagenter allerede leser. En utvikler ved navn Przemek la merke til at den aldri ble lastet inn. Lasteren er et innebygd plugin, og før den kjører, ber den en ekstern funksjon flagg om tillatelse. Med telemetri deaktivert, kan ikke flagget hentes, reserveverdien er falsk, og filen din hoppes over uten advarsel. Han beviste det med et kanarisk ord i en tom mappe.

3:43 Bedrock- og Vertex-brukere får den samme stillheten. Så å lese en fil fra din egen disk krever nå å ringe hjem. Løsningen er en en-linjes claude.md som importerer agents-filen, nøyaktig den ekstra filen denne funksjonen var ment å fjerne. Apple har den samme ideen med færre trinn.

macOS 27: av-bryteren for Apple Intelligence er borte

3:59 David Bushell slo av Apple Intelligence på macOS 15. Forrige uke oppgraderte han til 27, og bryteren som sa nei er borte. Funksjonene kom tilbake uansett, med tjueto gigabyte diskplass. Det som er igjen er Skjermtid, foreldrekontrollene, som skjuler menyene og slår ingenting av. Med hans ord, Jeg sa nei, og Apple sa ja.

Samsung: en testoppdatering frøs ekte kjøleskap

4:19 Og en fredagsutrulling, noen dager for tidlig. Samsung sendte ut en SmartThings-oppdatering til smarte kjøleskap i Korea, og sier feilen skjedde under testprosessen, som tydeligvis kjører på kundenes kjøkken. Kjøleskap mistet strøm, mat ble ødelagt, og teknikere bytter angivelig ut hovedkort før Chuseok-høytiden. Samsung kaller det nødforanstaltninger. Et sted lærer praktikanten at produksjon inkluderer kjøleskap.

4:42 Hvis du heller vil lese dette enn å høre meg si det, lander differansen i innboksen din hver morgen, gratis på the daily diff dot dev, lenke nedenfor.

Dom: NEEDS REVIEW på Opus 5.5

4:49 Så, dagens dom over Opus 5.5. NEEDS REVIEW. Priskuttet er reelt og det topper listen, men den uavhengige tellingen er uenig med token-effektiv, og nitti minutter senere var det den dyrere halvdelen av en priskrig. Abonner, trykk på bjellen, og fortell meg i kommentarene om du ville ha stemplet den annerledes. Og det er forskjellen for i dag. Jeg er Niko fra Axrisi. Flett ansvarlig.

Kilder

  1. Anthropic, Claude Opus 5.5www.anthropic.com
  2. Hacker News (1,645 pts)news.ycombinator.com
  3. OpenAI, Introducing GPT-6 Sol and Lunaopenai.com
  4. Hacker News (1,634 pts)news.ycombinator.com
  5. Simon Willison, Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna, and a new price warsimonwillison.net
  6. Artificial Analysis, Claude Opus 5.5artificialanalysis.ai
  7. Artificial Analysis, GPT-6 Solartificialanalysis.ai
  8. Thariq Shihipar on Xtwitter.com
  9. The Verge, Emma Rothwww.theverge.com
  10. Przemek, Claude Code reads AGENTS.md only when telemetry is onblog.szypowi.cz
  11. Hacker News (192 pts)news.ycombinator.com
  12. David Bushell, I said no and Apple said yesdbushell.com
  13. Hacker News (838 pts)news.ycombinator.com
  14. Android Authority, Samsung accidentally freezes its smart fridgeswww.androidauthority.com
  15. Last week's episode, Hacktron and the Opus 5 exploitwww.youtube.com

Relaterte videoer