+− THE DAILY DIFFdev & AI news
SHIP IT

¿Cómo detectar un "nerf" de Claude (con datos reales)?

La gente dice que Claude se vuelve menos inteligente unas semanas después de cada lanzamiento.

La gente dice que Claude se vuelve menos inteligente unas semanas después de cada lanzamiento. Un desarrollador puso a Claude Opus 5.5 en un reloj de 30 días desde la semana de lanzamiento, con preguntas fijas, un Claude Code "pineado" y reglas públicas. El experimento muestra por qué nadie podría haberlo sabido antes y por qué el recuento de tokens es lo que hay que vigilar. Veredicto: SHIP IT.

Leer la edición escrita (inglés) ↗

Qué cubre este vídeo

  • Claude se vuelve menos inteligente después del lanzamiento: la teoría se encuentra con un reloj de día cero
  • livenerf: un reloj de 30 días en Opus 5.5 desde la semana de lanzamiento
  • Cómo detectar un "nerf": 78 preguntas a veces correctas
  • Lo que puede ver: 7,5 puntos, y el recuento de tokens se mueve primero
  • El punto ciego: un intercambio de Opus 5 y 8 claves de respuesta incorrectas

Transcripción traducida

Traducido de la narración original en inglés. El audio y los subtítulos disponibles están controlados por YouTube.

Claude se vuelve menos inteligente después del lanzamiento: la teoría se encuentra con un reloj de día cero

0:00 Todo el mundo sabe que Claude se vuelve menos inteligente unas semanas después del lanzamiento. Así que un desarrollador puso a Opus 5.5 en un reloj desde la semana de lanzamiento, y el reloj dice que nadie podría haberlo sabido aún. En este vídeo, tres preguntas. ¿Cómo se detecta un "nerf"? ¿Qué puede ver este medidor? ¿Y qué dice Anthropic? Y una línea en los créditos del repositorio me hizo reír a carcajadas.

0:20 Llegaré a eso al final. Es miércoles, 30 de septiembre, y esto es The Daily Diff. Hoy tres historias, y la grande es un repositorio de GitHub llamado "livenerf".

livenerf: un reloj de 30 días en Opus 5.5 desde la semana de lanzamiento

0:30 Durante meses, la gente ha dicho que Anthropic "nerfea" silenciosamente sus modelos después del lanzamiento. Las teorías habituales son un modelo reducido, un modelo más pequeño bajo el mismo nombre o simplemente menos pensamiento. El repositorio llama a todos los argumentos hasta ahora "vibes versus vibes". Opus 5.5 fue lanzado el 22 de septiembre, y hace una semana os dije que encabezaba la lista independiente mientras escribía tres veces más palabras que el modelo medio. Dos días y medio después, un desarrollador llamado "ninja hawk" puso en marcha el reloj,

0:59 una vez al día durante treinta días, con registros que nadie puede editar. El hilo de Hacker News alcanzó casi 800 puntos y se dividió como un chat de equipo. Un comentarista dice que el "nerfeo" de modelos no es real en la gran mayoría de los casos reportados. Otro dice que la gente simplemente se está acostumbrando al nuevo nivel de inteligencia. Y un usuario avanzado de Claude Code ahora descarta la ventana emergente "valora esta sesión" cada vez, porque valorar a Claude parecía empeorarlo. Revisión por pares. Así que, pregunta uno, ¿cómo se detecta un "nerf"?

Cómo detectar un "nerf": 78 preguntas a veces correctas

1:27 Se empieza con unas 2300 preguntas de examen difíciles, y Opus acierta el 93% en el primer intento, lo cual es inútil para un detector, ya que una pregunta que siempre acierta no puede bajar. El 97% siempre fueron correctas o siempre incorrectas, y las 78 que solo a veces acierta se convirtieron en el panel. Misma "prompt", sin herramientas y calificación de coincidencia exacta sin juez de IA, porque el juez también se desviaría. Se ejecuta en una suscripción Max a través de un Claude Code sin interfaz gráfica,

1:55 ya que la versión de la API tenía un precio de unos 1600 dólares al mes. Y la versión de Claude Code está "pineada", porque, en palabras del repositorio, un "harness" modificado se ve exactamente como un modelo modificado. Las estadísticas provienen de un artículo llamado "Adding Error Bars to Evals", de Evan Miller de Anthropic. Así que las propias matemáticas de Anthropic están auditando ahora a Anthropic, que es la versión académica de citar los términos de servicio a atención al cliente.

Lo que puede ver: 7,5 puntos, y el recuento de tokens se mueve primero

2:19 Pregunta dos, ¿qué puede ver? Por cada ventana de diez días, una caída de unos 7,5 puntos. Para demostrar que el sistema funciona, el autor redujo intencionadamente el esfuerzo de Claude. El esfuerzo medio redujo la producción en aproximadamente una cuarta parte, y la puntuación en solo cuatro puntos. El esfuerzo bajo redujo la producción en casi dos tercios, para ocho puntos. Esa es la parte que hay que robar. Menos pensamiento aparece en el recuento de tokens antes de aparecer en las respuestas.

2:43 Así que "pinea" la versión de tu modelo, registra los tokens de salida por tarea, y guarda algunas preguntas fijas propias. Si tu agente de repente escribe más corto, revisa tus registros antes de revisar Reddit. Y aquí está la parte honesta.

El punto ciego: un intercambio de Opus 5 y 8 claves de respuesta incorrectas

2:54 El cambio silencioso al antiguo Opus 5 fue un cambio demasiado pequeño para que el sistema lo detectara, y el "readme" lo dice de antemano. La auditoría también encontró ocho claves de respuesta que parecen incorrectas, así que el detector de "nerfs" encontró errores en el "benchmark" antes de encontrar un "nerf".

Anthropic: nunca reducimos la calidad del modelo

3:08 Pregunta tres, ¿qué dice Anthropic? El año pasado, después de una ola de quejas, Anthropic publicó un "post-mortem". Dice, cito, "nunca reducimos la calidad del modelo debido a la demanda", "la hora del día o la carga del servidor". La misma publicación admite que tres errores habían degradado a Claude, y casi un tercio de los usuarios de Claude Code llegaron a los servidores equivocados al menos una vez. Así que las quejas eran reales y la causa eran errores, por lo que el repositorio advierte que la semana de lanzamiento podría ser la peor semana.

3:35 Seis de treinta días ya han pasado. La primera posible llamada aterriza alrededor del 24 de octubre, así que la respuesta honesta es que nadie lo sabe, incluyendo a todos los que estaban seguros. Hablando de números que nadie publica.

Los centros de datos mantienen sus números en secreto; Backblaze los publica

3:46 Lighthouse Reports y el periódico holandés Trouw descubrieron que la gran mayoría de los centros de datos europeos mantienen en secreto su consumo de energía y agua, aunque una norma de la UE ha exigido la notificación durante tres años. En los Países Bajos, menos de una cuarta parte publica. Un centro de datos de Microsoft por sí solo utiliza aproximadamente el uno por ciento de la electricidad holandesa. Mientras tanto, Backblaze volvió a hacer lo aburrido. Sus estadísticas trimestrales de unidades cubren unos 350.000 discos duros, y la tasa de fallos subió al 1,73%,

4:16 la más alta en mucho tiempo. Tres modelos de Seagate tuvieron cero fallos. Así es como se ve una línea de base pública, trimestre tras trimestre, durante trece años.

La línea de créditos: Claude ayudó a construir el medidor

4:25 Ahora, esa línea de créditos. El "readme" admite que gran parte del repositorio fue escrito con la ayuda de Claude, que es el modelo que se está midiendo. Así que Claude ayudó a construir el medidor que verifica si Claude se volvió menos inteligente. Por eso los calificadores son funciones simples. En palabras del autor, no deberías tener que confiar en el autor, humano o no. Si prefieres leer esto que oírme decirlo, el "diff" llega a tu bandeja de entrada

4:46 todas las mañanas, gratis en thedailydiff.dev, enlace abajo. Así que, el veredicto de hoy sobre "livenerf".

Veredicto: SHIP IT, y no lo cites antes del 24 de octubre

4:51 SHIP IT. Lo enviaría porque es el primer argumento de "nerf" que he visto con una marca de tiempo, un libro de reglas público y un punto ciego declarado. Simplemente no lo cites antes del 24 de octubre. Y esa es la diferencia de hoy. Soy Niko de Axrisi. Fusionar con responsabilidad.

Fuentes

  1. livenerfgithub.com
  2. Validationgithub.com
  3. Hacker Newsnews.ycombinator.com
  4. Anthropic postmortem (Sep 2025)www.anthropic.com
  5. Adding Error Bars to Evals (Evan Miller)arxiv.org
  6. Inspect (UK AI Security Institute)inspect.aisi.org.uk
  7. NL Timesnltimes.nl
  8. Hacker Newsnews.ycombinator.com
  9. Backblaze Drive Stats Q2 2026www.backblaze.com
  10. Hacker Newsnews.ycombinator.com

Vídeos relacionados