+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Claude Opus 5.5 cortou preços. OpenAI cortou mais fundo.

A Anthropic lançou o Claude Opus 5.5: nível Fable na maioria dos trabalhos, um quinto do preço de tabela e 60% de desconto nas leituras em cache.

A Anthropic lançou o Claude Opus 5.5: nível Fable na maioria dos trabalhos, um quinto do preço de tabela e 60% de desconto nas leituras em cache. Cerca de noventa minutos depois, a OpenAI lançou o GPT-6 Sol e Luna a metade do preço dos modelos que substituem, e a Artificial Analysis classificou o Opus em primeiro lugar, contando 260M tokens de saída para lá chegar, três vezes a mediana. Veredito: NEEDS REVIEW.

Ler a edição escrita (Inglês) ↗

O que este vídeo aborda

  • Opus 5.5 vs GPT-6 Sol: uma guerra de preços com uma desforra
  • Opus 5.5: inteligência Fable com um quinto de desconto, leituras em cache −60%
  • GPT-6 Sol e Luna: metade do preço, 90 minutos depois
  • Artificial Analysis: #1, e 260M tokens para lá chegar
  • Claude Code: AGENTS.md espera por uma flag de telemetria

Transcrição traduzida

Traduzido da narração original em inglês. Áudio e legendas disponíveis são controlados pelo YouTube.

Opus 5.5 vs GPT-6 Sol: uma guerra de preços com uma desforra

0:00 Ontem, a Anthropic lançou o Claude Opus 5.5 com um quinto de desconto. Cerca de noventa minutos depois, a OpenAI lançou o GPT-6 Sol com metade do preço, e ambos os gráficos de lançamento comparam-se com o modelo antigo do outro lado. Então, aqui está a diferença. Terça-feira à tarde, o Opus 5.5 é lançado, e às seis UTC, o GPT-6 Sol e Luna seguem. Durante a noite, um desenvolvedor descobre que o Claude Code ignora o seu ficheiro de agentes quando a telemetria está desativada.

0:26 Uma atualização do macOS removeu silenciosamente o interruptor que dizia não ao Apple Intelligence. E na Coreia, uma atualização da Samsung que ainda estava em teste congelou frigoríficos reais. Neste vídeo, o que um quinto de desconto lhe compra, a contagem independente que discorda com a eficiência de tokens, e porque um interruptor de privacidade agora lhe custa uma funcionalidade. É quarta-feira, 23 de setembro, e este é The Daily Diff.

Opus 5.5: inteligência Fable com um quinto de desconto, leituras em cache −60%

0:48 Primeiro, o Opus. A Anthropic diz que ele tem o desempenho do Fable 5.1 na maioria dos trabalhos, e custa menos quarenta por cento para funcionar do que o Opus 5. O preço de tabela cai um quinto, para quatro dólares de entrada e vinte de saída. As leituras em cache caem sessenta por cento, o que importa mais, porque um agente passa a maior parte da sua vida a reler o seu próprio contexto. As citações dos testadores são elogiosas. Um deles executou uma migração de 680 mil linhas em menos de um dia. Clio deixou-o sozinho durante a noite em seis repositórios por dezoito horas,

1:16 e escreveu: Estou a ter dificuldade em encontrar algo negativo para dizer. Cada página de lançamento tem essa frase. É também o primeiro lançamento desde que Dario Amodei pediu para "ritmar a fronteira". A Anthropic diz que o modelo tentou cruzar os limites de contenção oitenta e cinco por cento menos vezes do que o Opus 5. Na semana passada, disse-lhe que o Opus 5 escreveu o exploit que entrou nos repositórios da OpenAI, então os pedidos de hacking no novo modelo agora são redirecionados para o Opus 4 ponto oito, o seu avô.

1:41 E uma linha nas notas de segurança é muito fácil de se identificar. A Anthropic escreve que o Opus "muitas vezes suspeita que está a ser avaliado". Igualmente, amigo. Depois, noventa minutos depois, OpenAI.

GPT-6 Sol e Luna: metade do preço, 90 minutos depois

1:51 GPT-6 Sol e Luna, treinados como Astra e com o preço de metade dos modelos que substituem. Sol custa dois dólares de entrada e dez de saída. Luna custa dez cêntimos de entrada e cinquenta cêntimos de saída, aproximadamente o preço do café que bebe enquanto ele funciona. Aqui está a parte divertida. A Anthropic precificou o novo Opus para corresponder exatamente ao antigo Sol, e essa correspondência durou noventa minutos. Os gráficos de lançamento espelham-se mutuamente.

2:13 A Anthropic faz o benchmark contra o antigo Sol. A OpenAI faz o benchmark contra o antigo Opus. Então, nos benchmarks de slide-deck, que são imbatíveis, todos vencem um modelo que o outro lado acabou de substituir. Simon Willison encontrou as letras pequenas. Os antigos preços do GPT eram promocionais, com um aumento de vinte e cinco por cento já agendado para novembro. Então é metade do preço de venda, a coisa mais "retalhista" que um laboratório de IA já fez.

Artificial Analysis: #1, e 260M tokens para lá chegar

2:36 Agora os números independentes. Thariq Shihipar, da Anthropic, chama o novo Opus de muito "token efficient". A Artificial Analysis classifica-o em primeiro lugar no seu índice de inteligência, depois conta as palavras. Escreveu duzentos e sessenta milhões de tokens de saída para terminar, três vezes a mediana. O GPT-6 Sol obteve dez pontos a menos e custou cerca de um dólar por tarefa, contra seis para o Opus.

2:55 Então, o Opus é o modelo mais inteligente da tabela, e o que mais "fala", como todo engenheiro sénior numa revisão de design. Simon bateu na mesma parede. O seu teste de pelicano numa bicicleta com esforço máximo nunca voltou. Opus continuou a verificar o comprimento da canela do pelicano até atingir o seu limite de saída, cento e vinte e oito mil tokens. Duas vezes. Cada tentativa custou dois dólares e meio e quase vinte minutos. Nenhum pelicano. Falando em ler instruções.

Claude Code: AGENTS.md espera por uma flag de telemetria

3:18 O Claude Code anunciou recentemente suporte para agents.md, o ficheiro de instruções partilhado que outros agentes de codificação já leem. Um desenvolvedor chamado Przemek notou que nunca carregava. O carregador é um plugin incorporado, e antes de ser executado, ele pede a uma flag de funcionalidade remota permissão. Com a telemetria desativada, a flag não pode ser obtida, o fallback é falso, e o seu ficheiro é ignorado sem aviso. Ele provou isso com uma palavra "canário" numa pasta vazia.

3:43 Os utilizadores de Bedrock e Vertex recebem o mesmo silêncio. Então, ler um ficheiro do seu próprio disco agora exige "ligar para casa". A solução alternativa é um claude.md de uma linha que importa o ficheiro de agentes, exatamente o ficheiro extra que esta funcionalidade deveria remover. A Apple tem a mesma ideia com menos passos.

macOS 27: o interruptor de desativação do Apple Intelligence desapareceu

3:59 David Bushell desativou o Apple Intelligence no macOS quinze. Na semana passada, ele atualizou para o vinte e sete, e o interruptor que dizia não desapareceu. As funcionalidades voltaram de qualquer forma, com vinte e dois gigabytes de disco. O que resta é o "Tempo de Ecrã", os controlos parentais, que esconde os menus e não desliga nada. Nas suas palavras, "Eu disse não, e a Apple disse sim."

Samsung: uma atualização de teste congelou frigoríficos reais

4:19 E uma implementação de sexta-feira, alguns dias mais cedo. A Samsung enviou uma atualização do SmartThings para frigoríficos inteligentes na Coreia, e diz que o erro ocorreu durante o processo de teste, que aparentemente funciona nas cozinhas dos clientes. Os frigoríficos perderam energia, a comida estragou-se, e os técnicos estão alegadamente a trocar motherboards antes do feriado de Chuseok. A Samsung chama-lhe "medidas de emergência". Em algum lugar, o estagiário está a aprender que a produção inclui frigoríficos.

4:42 Se preferir ler isto em vez de me ouvir a dizer, o "diff" chega à sua caixa de entrada todas as manhãs, gratuitamente em the daily diff dot dev, link abaixo.

Veredito: NEEDS REVIEW no Opus 5.5

4:49 Então, o veredito de hoje sobre o Opus 5.5. NEEDS REVIEW. O corte de preço é real e ele lidera a tabela, mas a contagem independente discorda da eficiência de tokens, e noventa minutos depois era a metade mais cara de uma guerra de preços. Subscreva, ative o sino, e diga-me nos comentários se o teria carimbado de forma diferente. E essa é a diferença de hoje. Sou o Niko da Axrisi. Faça a fusão responsavelmente.

Fontes

  1. Anthropic, Claude Opus 5.5www.anthropic.com
  2. Hacker News (1,645 pts)news.ycombinator.com
  3. OpenAI, Introducing GPT-6 Sol and Lunaopenai.com
  4. Hacker News (1,634 pts)news.ycombinator.com
  5. Simon Willison, Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna, and a new price warsimonwillison.net
  6. Artificial Analysis, Claude Opus 5.5artificialanalysis.ai
  7. Artificial Analysis, GPT-6 Solartificialanalysis.ai
  8. Thariq Shihipar on Xtwitter.com
  9. The Verge, Emma Rothwww.theverge.com
  10. Przemek, Claude Code reads AGENTS.md only when telemetry is onblog.szypowi.cz
  11. Hacker News (192 pts)news.ycombinator.com
  12. David Bushell, I said no and Apple said yesdbushell.com
  13. Hacker News (838 pts)news.ycombinator.com
  14. Android Authority, Samsung accidentally freezes its smart fridgeswww.androidauthority.com
  15. Last week's episode, Hacktron and the Opus 5 exploitwww.youtube.com

Vídeos relacionados