RLDR LEARNING NOTE

첫 자동화 AI 연구자는 현실적인 실패를 어디서 배울까

Dwarkesh Patel, John Schulman, Beren Millidge, Charlie O'Neill의 대화에서 증류의 한계, 난이도와 현실성의 두 축, 연구자 taste, 배포 데이터와 reward 설계를 연결한다.

기존 RLDR 편집본 19분 11초의 원본 세 구간(18:40.320–28:05.600, 28:06.720–33:50.320, 41:22.560–45:24.560)에, 별도 하이라이트의 원본 42:59.760–50:12.720을 더해 다룹니다. 두 공개본의 겹치는 부분과 새로 이어지는 장기 과업 논의를 구분하며 원본 전체를 다루지는 않습니다.

선도 모델의 답을 복제해도 실제 사용자의 분포가 없으면 추격이 멈춘다

첫 구간은 중국 AI 연구소가 frontier model을 따라잡는 경로를 논의한다. 증류는 강한 teacher의 출력과 행동을 student가 따라가게 해 격차를 줄일 수 있다. 그러나 benchmark 문제에서 teacher 답을 복제하는 것과 실제 업무에서 유용한 행동을 복제하는 일은 다르다. 00:00–03:20

화자들은 라우터나 proxy에서 얻는 실제 사용자 prompt와 후속 행동이 경쟁력의 중요한 원천일 수 있다고 주장한다. 중국 연구소가 특정 데이터를 어느 범위까지 확보하고 사용한다는 발언은 대담 참여자의 주장이다. 독립적으로 확인된 조사 결과처럼 받아들이면 안 된다. Sonnet 5, Opus 5, GLM-5.3, Kimi K3에 관한 상대 평가는 화자의 체감과 가설이며 통일된 benchmark 비교가 아니다.

증류의 효과는 teacher의 능력뿐 아니라 student가 보는 task distribution에 달려 있다. 쉬운 정답형 benchmark만 있으면 그 분포에서의 모방은 좋아질 수 있다. 다중 목표, 긴 도구 사용, 사람과의 왕복이 필요한 prompt가 빠져 있으면 teacher가 그 상황에서 보이는 판단을 student가 연습할 기회가 없다.

검증하기 어려운 현실성은 고난도 퍼즐과 별도의 축이다

Beren Millidge는 environment를 난이도와 현실성의 두 축으로 나누는 가설을 제시한다. 검증하기 쉬운 고난도 퍼즐은 많이 만들 수 있다. 답이 분명하고 자동 채점이 가능하기 때문이다. 그는 이 분포를 benchmaxxing이라고 부른다. 반면 현실적인 코딩 agent는 사람과 여러 번 대화하고, 여러 목표를 조정하며, 조직별 선호를 따라야 한다. 06:22–08:16

benchmark 난이도와 현실성의 차이를 설명하는 대담 화면
검증하기 쉬운 고난도 퍼즐과 다중 목표의 현실 업무를 다른 축으로 보자는 가설. RLDR 본편 07:00.원본 장면 7:00

공개 쇼츠는 본편 06:22.360–08:15.670, 원본 25:02.680–26:55.990을 쓴다. 쇼츠의 핵심은 ‘어려운 문제를 잘 푼다’와 ‘현실에서도 잘한다’를 같은 축으로 놓지 말자는 화자의 가설이다. 정량 비교표나 현실성 benchmark 결과가 이 구간에 있는 것은 아니다.

frontier lab은 두 축을 모두 밀어야 한다는 것이 화자의 주장이다. 현실성 축에서는 rubric과 사람 피드백이 reward function에 들어가야 한다. 단순 증류는 teacher를 benchmaxxing 분포에서만 따라갈 위험이 있다. 큰 모델이 좁고 어려운 task에서 현실적인 task로 더 잘 일반화할 수 있다는 말도 가능성 표현이다. 08:16–09:25

이 구분은 eval 제작 비용을 설명한다. 퍼즐의 정답은 자동 채점할 수 있지만, 적절한 순간에 질문하고 여러 이해관계자의 목표를 조정했는지는 rubric과 실제 사용자 판단이 필요하다. 현실성을 높일수록 grader도 환경의 일부가 된다.

좋은 prompt distribution은 능력보다 행동 양식을 옮긴다

student가 teacher의 능력을 갖고 있어도 어떤 상황에서 그 능력을 꺼내야 하는지 배우지 못할 수 있다. 현실적인 prompt distribution에는 불완전한 지시, 조직 특유의 도구, 후속 수정, 여러 목표가 함께 있어야 한다. 화자들은 frontier model의 우위가 단순한 RL environment 보유보다 실제 사용 데이터와 post-training 품질에 있을 수 있다고 본다. 03:20–06:22

제품에서 수집한 prompt도 자동으로 대표성을 갖지 않는다. 활발한 사용자와 초보 사용자의 비율, 무료와 기업 고객, 실패 뒤 떠난 사용자와 남아 수정한 사용자의 분포가 다르다. proxy 데이터는 접근 가능한 행동만 보여 준다. 실제 의도와 만족, 권리 범위를 별도 확인해야 한다.

훈련 데이터 설계에서는 난이도와 현실성 외에 권한 축도 필요하다. 현실적인 사내 문서와 사용자 trace가 있다고 해도 평가와 학습, 파생물에 대한 권리가 분리돼 있을 수 있다. 사용 데이터의 희소성이 경쟁 우위를 만들 수 있다는 전망과, 그 데이터를 정당하게 학습에 쓸 수 있다는 사실은 같지 않다.

연구 자동화에서 가장 늦게 남는 일은 좋은 질문을 고르는 판단일 수 있다

두 번째 구간은 첫 자동화 AI 연구자를 어떻게 훈련할지 묻는다. 실험 실행과 코드 작성은 측정 가능한 목표를 만들기 쉽다. 그러나 어떤 연구 방향이 중요한지, 이상한 결과를 더 파고들지, metric 자체를 바꿀지 정하는 일에는 연구자의 taste와 직관이 들어간다. 화자들은 사람 피드백으로 이 판단을 모델에 전달할 수 있다고 본다. 09:25–11:42

여기서 taste는 분위기 있는 문체가 아니라 연구 선택의 기준이다. 여러 가설 가운데 무엇을 먼저 검증할지, 결과가 애매할 때 어떤 후속 실험이 정보량이 큰지, 단기 점수보다 장기 연구 가치를 어떻게 볼지를 포함한다. 정답 trajectory가 하나뿐이지 않을 수 있으므로, 전문가의 비교와 수정 이유가 중요한 데이터가 된다.

사람 피드백을 많이 모으면 자동으로 좋은 taste가 생기는 것도 아니다. 연구자 사이에 판단이 다르고, 과거 성공 사례를 과도하게 모방하면 새로운 방향을 놓칠 수 있다. feedback을 준 사람과 맥락, 명시적 이유와 결과를 분리해 기록해야 한다. 이것은 영상의 전망을 구현 관점으로 확장한 해석이다.

직전 모델의 버그를 다음 training environment로 바꾸는 반복이 연구자를 만든다

자동화 연구자를 훈련하는 한 경로는 여러 단계의 연구 프로젝트를 environment로 만드는 것이다. 모델이 논문을 읽고, 코드를 수정하고, 실험을 실행하고, 결과를 해석하도록 한다. 직전 모델이 실패한 지점을 새 task와 grader로 바꿔 다음 모델에 제공한다. 11:42–15:09

첫 자동화 AI 연구자의 훈련 과정을 논의하는 화면
연구자의 판단을 피드백으로 받고 여러 단계 연구 environment에서 연습시키는 논의. RLDR 본편 12:20.원본 장면 12:20

연구 과정은 서로 이어진다. 가설이 실험을 만들고, 모델이 거친 행동과 결과가 평가를 받으며, 그 결과가 다음 학습 과제와 시스템 수정으로 이어진다. 연구 대화록을 많이 모으는 것과 실제 상태 변화, 도구 행동, 종료 조건, 채점 기준이 있는 environment를 만드는 일은 다르다.

측정 가능한 objective가 있는 좁은 영역에서는 AI가 인간 연구자의 실행량을 넘어설 수 있다는 전망이 나온다. 그러나 objective 자체가 잘못됐거나 현실 연구의 핵심을 놓치면 빠른 최적화가 잘못된 방향을 강화한다. 자동화 AI 연구자의 성능을 benchmark 점수만으로 보지 말고, 새 가설의 재현성, 후속 실험의 정보량, 기존 결과와의 모순 처리까지 평가해야 한다. 15:09–15:24

배포 데이터는 다음 세대 모델을 이미 바꾸지만, 즉시 학습은 별개의 문제다

세 번째 구간은 production 상호작용을 학습에 연결하는 문제로 넘어간다. 배포 데이터를 선별해 다음 세대 모델의 pre-training, mid-training, post-training에 넣는 방식은 가능하다. 하지만 개별 모델이 경험 직후 안전하게 좋아지는 continual learning은 reward 설계, 높은 분산, catastrophic forgetting을 해결해야 한다. 15:09–16:47

새 하이라이트는 이 문제에서 출발한다. Charlie O’Neill은 개별 모델이 경험 즉시 가중치를 바꾸는 이상적인 모습과, 사람이 신호를 고르고 환경을 만들어 다음 모델을 배포하는 현재의 긴 주기를 구분한다. Composer와 Harvey를 예로 들며, 고객 불만과 업무별 데이터를 구체적인 훈련 환경으로 바꾸는 기업이 그 데이터를 잘 사용할 여지가 있다고 본다. Kimi K3를 post-training해 배포한다는 이야기도 이런 흐름을 설명하는 예시이지, 이 글이 확인한 특정 회사의 내부 학습 구성은 아니다. 새 하이라이트 0:00–1:16

Cursor 사례에서는 사용자의 Tab 수락을 신호로 쓰는 옛 자동완성 모델이 먼저 거론된다. O’Neill은 생성 모델 Composer에도 비슷한 학습 방식을 적용했다고 구분한다. 실제 요청 하나에서 rollout 하나만 얻으면 여러 결과를 비교하기 어려워 학습 신호의 분산이 커진다. 화자들은 heuristic으로 응답이 평균보다 얼마나 좋거나 나쁜지 추정해 REINFORCE update를 하고, 평가를 통과한 모델을 몇 시간 주기로 배포하는 흐름을 설명한다. 두 공개본에 겹쳐 들어간 같은 논의다. 기존 편집본 18:02–19:11, 새 하이라이트 1:16–2:24

Cursor의 공식 설명에서 확인할 수 있는 범위는 조금 더 구체적이다. 회사는 상호작용 수집, 보상 신호 구성, 가중치 갱신, CursorBench를 포함한 평가와 배포까지 약 5시간이 걸린다고 설명한다. 개별 사용자의 수락 직후 그 개인용 모델이 바뀐다는 뜻은 아니다. 이 절차도 회사가 공개한 운영 설명이며, 학습 효과를 이 글에서 독립 재현한 것은 아니다. Cursor의 공식 설명

John Schulman은 자연스러운 사용 행동을 어떤 reward로 바꿀지 모른다는 문제가 더 근본적이라고 지적한다. reward 논의 1:36–2:24 기술적으로 보면 edit 수락은 편의를 위한 행동일 수도 있다. 짧은 답을 수락했다고 더 정확했다는 뜻은 아니며, 이런 피상적 신호는 reward hacking의 대상이 될 수 있다. 배포 주기가 빠르다는 사실만으로 유용한 학습이 일어났다고 판단할 수는 없다. 무엇이 좋아졌는지 확인하는 평가가 함께 필요하다.

과업이 길어질수록 시뮬레이션 밖의 사람을 만나야 한다

Dwarkesh Patel은 장기 과업이 늘수록 데이터센터 안에서 현실을 충분히 재현할 수 있느냐고 묻는다. 1년 동안 이어지는 코딩 과업이라면 언젠가는 고객, 회사, 실제 사용자와 대화해야 한다. 사업을 시작해 수익을 내거나 거래에서 돈을 벌고 소송에서 이기는 과업은 실행 코드만 복제해서 완성할 수 없다. 다른 사람의 판단과 변화하는 조건이 결과의 일부이기 때문이다. 긴 과업과 현실의 상호작용 2:24–3:09

질문은 두 갈래로 나뉜다. 시뮬레이션에서 배운 능력이 현실로 충분히 전이된다면 실제 상호작용마다 가중치를 바꿀 필요가 적을 수 있다. 반대로 현실에서 겪은 경험으로 추가 학습해야 한다면, 적은 경험에서 얼마나 많이 배우는지가 병목이 된다. Patel은 모델이 인간보다 가중치 학습에 훨씬 많은 데이터를 필요로 한다는 직관을 제시한다. ‘백만 배’라는 표현과 향후 10년 안의 강한 자기개선 전망도 이 질문 안에 나오지만, 영상이 통일된 조건으로 측정한 비교나 확정한 일정은 아니다. 전이와 표본 효율 질문 3:09–4:14

이 질문을 eval 설계로 옮기면 성공률뿐 아니라 학습에 필요한 경험 수를 봐야 한다. 동일한 시뮬레이션 과제에서 높은 점수를 받는 모델도 실제 사용자의 예외를 처음 만났을 때 적응하지 못할 수 있다. 반대로 적은 교정만으로 바뀐 업무에 적응한다면 초기 점수가 조금 낮아도 다른 가치가 있다. 이는 대담의 두 갈래를 실험 조건으로 정리한 해석이며, 공개 구간에는 이를 판별한 실험 결과가 없다.

연구 성과는 쌓일 수 있지만 회사의 업무 조건은 계속 바뀐다

Charlie O’Neill은 과업을 누적 가능한 문제와, 분포가 바뀌어 다시 배워야 하는 문제로 나눈다. 재귀적 자기개선이 앞의 종류일 수 있다는 것이 그의 가설이다. attention, mixture of experts, GRPO 같은 방법을 한 번 발견해 학습 코드에 넣었다면 다음 모델을 만들 때 매번 다시 발견할 필요는 없다. 그는 100만 토큰보다 작은 Python 파일로 자기개선 가능한 모델을 학습시킬 수도 있다는 이론적 예시를 든다. 그런 시스템을 이 대담에서 구현하거나 검증했다는 뜻은 아니다. 누적되는 과업의 가설 4:14–5:01

대담에 나오는 ‘5.6 Sol이 5.6 Terra를 학습시킨다’는 모델 예시도 같은 논점을 위한 발언이다. O’Neill은 어떤 모델을 학습시켰는지 단정하지 않고, 기존 pre-training과 post-training 스크립트를 호출했을 것이라고 추측한다. 핵심은 이 특정 모델 조합의 사실 여부가 아니라, 이미 확보한 방법을 코드에 쌓아 다음 실험에서 재사용할 수 있느냐는 구분이다. 모델과 스크립트 예시 5:01–5:14

회사에서 법률 보조 업무를 하는 agent는 다른 문제를 만난다. 누가 누구와 협업하는지, 어떤 정보가 어디에 있는지, 어떤 관행을 따라야 하는지가 바뀐다. 과거에 맞았던 답을 계속 쌓기만 해서는 현재의 관계와 절차를 따라가지 못한다. O’Neill은 이처럼 시간이 흐르며 분포가 계속 바뀌는 과업이 지속 학습을 요구한다고 본다. 법률 보조 업무의 예 5:14–5:46

회사 안에서 계속 바뀌는 인물 관계와 업무 맥락을 설명하는 대담 장면
법률 보조 agent는 계속 바뀌는 관계와 암묵적 절차를 따라가야 한다는 예시. 새 하이라이트 5:29.033 장면이다.원본 장면 5:29.033

그는 연구소가 자기개선을 누적 가능한 문제로 판단한다면 그쪽에 더 많은 노력과 연산을 배분할 수 있다고 전망한다. Patel이 법률 보조 업무보다 자기개선이 쉽다니 안타깝다고 농담하는 대목도 이 가정을 받아친 것이지 난이도를 실측한 결론은 아니다. 연구 자원 배분의 전망과 반응 5:46–6:05

두 종류를 모든 업무에 고정된 꼬리표로 붙일 필요는 없다. 연구에서도 새로운 목적과 제약이 생기고, 회사 업무에서도 안정적으로 재사용하는 절차가 있다. 기술적으로는 무엇을 장기 기억이나 코드로 남길지, 무엇을 최신 context에서 다시 확인할지 분리하는 기준으로 이 가설을 사용할 수 있다. 이 구분은 대담에서 제안한 설명이지, 연구 자동화가 일반 업무 자동화보다 반드시 먼저 완성된다는 증거는 아니다.

적게 배우는 능력과 오래 판단하는 능력은 같은 문제가 아니다

John Schulman은 표본 효율을 모든 시간 범위에서 하나의 숫자로 취급하지 않는다. 모델은 context 안에서 주어진 사례를 활용할 때는 매우 적은 예로도 잘 배울 수 있다. 반면 중간 정도 길이의 경험을 장기적인 변화로 남기는 상황에서는 인간이 더 효율적일 가능성이 있다는 답이다. 인간과 모델의 차이는 어느 종류의 학습을 비교하는지에 따라 달라진다. 표본 효율을 나누어 보는 답 6:05–6:41

그는 낮은 사고의 다양성이나 특정 장기 판단의 약점은 표본 효율과 별개일 수도 있다고 덧붙인다. 사람들이 taste라고 부르는 능력의 일부는 오랜 시간 잘 작동하는 행동이 무엇인지 알아보는 판단이라는 설명이다. 공개 편집본은 이 설명의 도입에서 끝난다. 뒤에 이어지는 원본 대화까지 이 영상에 포함된 것처럼 다루지 않는다. 사고의 다양성과 장기 판단 6:41–7:13

따라서 지속 학습의 평가는 업데이트 빈도를 세는 데서 멈출 수 없다. 짧은 피드백에서 적절한 신호를 얻는지, 새 조건에 적응하면서 기존 능력을 보존하는지, 장기 과업에서 필요한 질문과 방향을 고르는지를 나눠 봐야 한다. 이 세 조건을 구분해야 빠르게 변하는 모델이 무엇을 더 잘하게 됐는지 설명할 수 있다.

AI의 사고 다양성과 장기 판단 한계를 설명하는 인터뷰 장면
화자는 샘플 효율과 별개로 사고의 다양성과 장기 판단도 현재 모델의 약점일 수 있다고 말한다. 부모 영상의 실제 프레임이며 이 Short의 원본 구간에 해당한다.원본 장면 6:49.9

재귀적 자기개선의 속도는 실행 자동화와 목표 설정을 함께 봐야 한다

앞서 다룬 연구자 훈련 논의를 함께 보면 자동화 AI 연구자의 학습 재료가 연결된다. teacher model의 행동을 증류하고, 현실적인 prompt distribution에서 연습하며, 전문가의 taste를 피드백으로 받고, production trace에서 새 실패를 찾는다. 각 고리는 다른 증거와 권한을 요구한다.

재귀적 자기개선이 빠르게 일어날 수 있다는 전망은 실험 실행을 자동화하는 능력만으로 결정되지 않는다. 어떤 목표를 최적화할지, 새 결과가 실제 진전인지, 현실적 환경을 어떻게 만들지, 업데이트가 기존 능력을 망가뜨리지 않았는지 판단해야 한다. 영상은 목표가 명확한 최적화와 새로운 연구 방향을 고르는 일을 구분한다.

중국 연구소의 추격, frontier model의 일반화, 첫 자동화 연구자의 훈련법은 대담 참여자들의 가설과 전망이다. Cursor의 production 학습 루프처럼 회사 자료로 확인되는 현재 사례도 있다. 이 둘을 한 문장으로 합쳐 ‘자동화 연구자가 이미 스스로 개선한다’고 말하면 시간과 증거 수준이 섞인다.

첫 자동화 AI 연구자의 eval은 어려운 퍼즐을 더 많이 푸는지에서 끝나지 않아야 한다. 현실적인 다중 목표를 다루고, 좋은 후속 질문을 고르며, 실험 결과를 재현하고, 사용자와 연구자의 수정에서 배우되 권한과 회귀를 보존하는지 확인해야 한다. 난이도와 현실성은 다른 축이고, 학습 속도와 연구 방향의 질도 다른 축이다.

더 읽을 자료

  1. Dwarkesh Podcast 원본 영상
  2. Dwarkesh Podcast 공식 transcript
  3. Cursor real-time RL for Composer
  4. Cursor Composer
  5. 지속 학습과 장기 과업의 RLDR 하이라이트원본 42:59.760–50:12.720. 본문 새 시간 링크는 이 공개 편집본 기준이다.