내막을 들여다본 재귀적 자기 개선
Google DeepMind는 "Dream-RSI: 진화하는 세계를 통한 재귀적 자기 개선"을 발표했습니다.
Google DeepMind는 "Dream-RSI: 진화하는 세계를 통한 재귀적 자기 개선"을 발표했습니다. 이 안에 있는 코딩 모델은 결코 변하지 않습니다. 내막을 들여다보면: 60년 동안 이 문구가 무엇을 의미했는지, Dream-RSI에서 실제로 반복되는 것(기록된 검색 트리를 "꿈꾸는" Python 탐색 정책), 그리고 550 대신 317 에이전트 호출이 이륙이 아니라 할인인 이유를 알 수 있습니다. 평결: NEEDS REVIEW.
이 동영상에서 다루는 내용
- 1965년 → 2008년: I. J. Good의 "지능 폭발", 유드코프스키의 시드 AI — 자체 가중치를 재작성하는 기계
- 2025년: AlphaEvolve — 48번의 곱셈을 하는 4×4 행렬 곱셈, Google 컴퓨팅의 0.7% 회수, Gemini 커널 23% 더 빠름
- 2026년: Dream-RSI — 정책은 개선되지만 코더, 심사관 및 재작성기는 모두 고정됨; 프롬프트는 "과학적 과제를 해결하지 마시오"라고 지시함
- X: "Google이 재귀적 자기 개선을 막 해냈다" (819 좋아요) 대 HN: "이것을 RSI라고 부르는 것은 오해의 소지가 있어 보인다"
- 사용된 숫자: §4.1 Lasso 550 → 317 에이전트 호출, 3587 → 2931 ms; 표 1 원형 패킹 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43배 / 1.79배 더 적은 세대, 최대 2.09배 더 빠름; 부록 B.2 프롬프트 (모두 위 PDF에서 발췌)
번역된 스크립트
원래 영어 내레이션에서 번역되었습니다. 사용 가능한 오디오 및 캡션은 YouTube에서 제어합니다.
0:00 재귀적 자기 개선은 AI가 스스로를 더 똑똑하게 만들고, 그 후에 더 똑똑해진 자신을 사용하여 다시 반복한다는 아이디어입니다. 그리고 이번 주 구글은 제목에 이 두 단어가 포함된 논문을 발표했는데, 이 논문에서는 모델의 가중치가 전혀 움직이지 않습니다. 세 가지 숫자입니다. Anthropic의 CEO는 이 루프가 여름부터 실행되고 있다고 말하며, 이것이 그가 전체 산업을 늦추려는 이유입니다. 구글이 방금 해냈다고 알리는 트윗은 하루 만에 800개의 좋아요를 모았습니다.
0:24 그리고 그 논문의 주요 결과는 550 대신 317번의 모델 호출이며, 이것은 이륙이 아니라 할인입니다. 3분 안에: 그 문구가 어디서 왔는지, Dream-RSI 안에서 실제로 무엇이 반복되는지, 그리고 표지에 RSI가 있는 다음 논문을 어떻게 읽어야 하는지 알아보겠습니다. 여기는 The Daily Diff, 내막을 들여다봅니다. 1965년. I. J. 튜링 옆에서 일했던 블레츨리 파크의 통계학자 굿은 초지능 기계가 더 나은 기계를 설계할 수 있다고 쓰고,
0:52 이를 지능 폭발이자 인류가 만들어야 할 마지막 발명품이라고 부르며, 단, 기계가 충분히 유순하여 우리가 그것을 제어하는 방법을 알려줄 수 있어야 한다는 조건이 있었는데, 사람들은 쉼표 뒤의 조건부 문장을 읽지 않습니다. 40년 동안 이 문구는 정확히 그것을 의미했습니다: 자체 소스나 가중치를 편집하고 매번 더 똑똑해지는 시스템을 말합니다. 엘리에저 유드코프스키의 2008년 에세이는 그것을 AI 안전의 핵심 단어로 만들었으며, 아무도 그것을 테스트할 기계가 없었으니, 이는 정의에 이상적인 조건이었습니다. 그러다 2025년 5월 DeepMind는 AlphaEvolve를 출시했습니다.
1:23 이것은 코드를 제안하고, 점수를 받고, 우승자를 유지하고 다시 변이시키는 Gemini 에이전트입니다. 48단계로 4x4 복소수 행렬을 곱하여, 1969년 슈트라센이 세운 기록을 깼고, Google 전 세계 컴퓨팅의 약 0.7% 를 회수하는데, Google 규모에서는 이것이 소파 밑에서 발견된 데이터 센터와 같습니다. 이제 Gemini가 Gemini 훈련을 돕고 있었고, 이 문구는 조용히 안전 블로그에서 보도 자료로 옮겨갔습니다. Dream-RSI는 그 루프 위에 컨트롤러를 장착합니다.
1:52 정책, 실제 Python 프로그램이 검색 트리의 어떤 가지를 확장할지, 얼마나 많이 병렬로 할지, 그리고 언제 포기할지를 결정합니다. Gemini가 후보 코드를 작성하고, 고정된 평가자가 점수를 매깁니다. 모든 실행은 시도된 것과 그 점수의 트리를 남깁니다. 그 트리는 재생 시뮬레이터가 됩니다: 두 번째로, 동일하게 고정된 Gemini가 정책을 다시 작성하고, 새 정책은 실제 GPU 대신 기록된 결과에 대해 테스트됩니다.
2:16 이 논문은 이것을 꿈꾸는 것이라고 부르며, 한 번의 실제 실행으로 수천 번의 꿈꾸는 실행을 실행 비용 없이 처리할 수 있습니다. 우승자는 다시 온라인으로 돌아가고, 기록된 세계의 풀은 성장하며, 반복됩니다. 그리고 부록 B.2의 프롬프트는 자기 개선 AI에게 문서로 지시합니다: 이 파일 하나만 편집하고, 과학적 과제를 해결하지 마시오. 측정되었습니다. Lasso 해결기 작업에서 고정 탐색은 550번의 Gemini 호출을 사용하여 3.6초에 도달했고, Dream-RSI는 317번을 사용하여 2.9초에 도달했으며, 둘 다 scikit-learn을 능가했습니다.
2:46 KernelBench에서는 약 2.4배 더 적은 세대로 동일한 커널 속도에 도달했습니다. 그리고 원형 패킹에서는 2.635983점을 기록했는데, 이는 작년에 AlphaEvolve 버전 2가 기록한 점수와 정확히 소수점 여섯 자리까지 일치합니다. 작년에 기록한 점수와 같습니다. 그래서 X는 제목을 읽었습니다: Google이 재귀적 자기 개선을 막 해냈다. Hacker News는 PDF를 읽었습니다: 이것을 RSI라고 부르는 것은 오해의 소지가 있어 보인다. 그리고 같은 주에 경쟁사의 CEO는 그 루프가 여름부터 실행되고 있었으며 모두 속도를 늦춰야 한다고 말했습니다.
3:13 세 문장, 같은 두 단어, 세 가지 다른 기계. 그래서 월요일, 다음 RSI 논문을 읽는 방법. 첫째: 어떤 객체가 변하는지 묻습니다. 가중치, 코드, 아니면 검색 설정인가요? Dream-RSI는 세 번째를 변경합니다. Dream-RSI는 세 번째를 변경합니다. 둘째: 누가 고정되어 있는지 묻습니다. 여기서는 코더, 심사관, 재작성기, 이 셋 모두입니다. 셋째: 주요 숫자가 무엇의 단위인지 묻습니다. 셋 모두. 셋째: 주요 숫자가 무엇의 단위인지 묻습니다. 절약된 컴퓨팅은 최적화입니다. 모델이 이전에 도달할 수 없었던 벤치마크는 이륙이며, 아직 아무도 그것을 발표하지 않았습니다.
3:40 평결, 내막을 들여다본 결과: NEEDS REVIEW. 루프는 실재하며, 절약은 측정되었고, 표지의 두 단어는 논문에 없는 기계를 설명합니다. 제가 말하는 것을 듣는 것보다 이 글을 읽고 싶으시다면, The Daily Diff는 매일 아침 무료로 daily diff.dev에서 이메일로 발송되며, 링크는 아래에 있습니다. 댓글로 다음에 무엇을 열어볼지 알려주세요. 그리고 이것이 오늘의 diff입니다. 저는 Axrisi의 Niko입니다.
4:00 책임감 있게 병합하세요.
출처
- Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
- Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
- Hacker News thread (169 points)news.ycombinator.com
- Hugging Face papers (278 upvotes)huggingface.co
- I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
- Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
- Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
- Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
- Tweetx.com



