RLDR LEARNING NOTE

지속 학습을 120B와 백 번의 도구 호출까지 키우면 무엇이 깨질까

Ronak Malde의 발표를 따라 SFT, DPO, GRPO에서 on-policy self-distillation으로 이동하는 이유와 긴 trajectory에서 생기는 but-wait, hint leakage, residual guidance 문제를 정리한다.

AI Engineer가 공개한 23분 03초 발표와 Q&A 전체의 RLDR 한국어 자막본을 다룬다. 수치와 성능은 화자 또는 Trajectory의 자체 보고이며 조건이 공개된 독립 결과와 구분한다.

실제 사용의 한 번뿐인 trajectory를 학습하려면 네 조건이 필요하다

발표의 출발점은 benchmark가 포화하고 비싸지는 동안, 실제 제품에서는 모델의 성공과 실패를 담은 trace가 계속 버려진다는 주장이다. 화면의 하루 100조 token은 화자의 업계 추정이며 공개 독립 통계가 아니다. 중요한 질문은 그 규모보다 실제 사용 분포에서 생긴 한 번의 경험을 학습할 수 있는가에 있다. 00:00–02:51

Ronak Malde는 좋은 학습 알고리즘의 네 속성을 제시한다. 실제 제품의 online task distribution, 현재 모델이 만든 on-policy sampling, 같은 과제를 여러 번 복제하지 않아도 되는 single rollout, 결과 점수 하나보다 촘촘한 per-token dense feedback이다. 이것은 모든 학습법의 표준 분류라기보다 발표가 세운 비교 프레임이다. 02:51–03:42

네 조건이 필요한 이유는 현실의 상호작용이 재실행 가능한 benchmark와 다르기 때문이다. 사용자는 한 번 질문하고, 모델은 한 번 행동하며, 그 다음 상태는 이미 바뀐다. 같은 사용자를 여덟 번 복제해 서로 다른 답을 보여 줄 수 없다. 최종 성공 여부만 있으면 어느 단계가 도움을 줬고 어디서 경로가 틀어졌는지 알기 어렵다.

SFT, DPO, GRPO는 서로 다른 것을 얻고 서로 다른 것을 포기한다

SFT는 큐레이션한 정답 trajectory의 각 token을 학습한다. 촘촘한 신호를 주고 많은 병렬 환경을 요구하지 않지만, 현재 모델이 실제로 만드는 오류에서 출발하지 않는다는 점에서 off-policy다. DPO와 RLHF는 선호 쌍이나 전체 응답의 보상을 사용해 선택 방향을 줄 수 있지만, 발표의 프레임에서는 여전히 고정 데이터와 sequence-level signal에 가깝다. 03:42–05:22

GRPO는 현재 정책이 같은 task에서 여러 rollout을 만든다. 결과 점수를 그룹 평균과 비교해 advantage를 계산하므로 on-policy 학습을 할 수 있다. 그 대가로 여러 병렬 rollout, 되돌릴 수 있는 environment, 각 결과를 채점할 verifier가 필요하다. 화자는 이를 ‘파우스트식 거래’라고 부른다. 05:22–07:04

에세이에 87점만 적어 돌려주는 비유는 sequence-level reward의 정보 부족을 설명한다. 100점과의 13점 차이는 알려 주지만, 어떤 문장과 추론 단계가 문제인지 말하지 않는다. 모델은 긴 trajectory 전체를 두고 희박한 신호에서 원인을 추정해야 한다. 실제 구현에서 과정 보상이나 verifier를 추가할 수 있으므로, 영상의 비교를 모든 GRPO 시스템의 필연으로 일반화해서는 안 된다. 07:04–07:52

같은 모델이 hint를 보면 teacher가 되고, 보지 않으면 student가 된다

일반 distillation에서는 더 강한 teacher와 student가 고정 데이터셋을 함께 읽고, student가 teacher의 token 분포를 따라간다. on-policy distillation은 고정 데이터를 student가 방금 만든 trajectory로 바꾼다. 하지만 최전선에서는 더 강한 teacher가 없을 수 있다. 발표가 제안하는 self-distillation은 같은 모델에 privileged hint를 추가해 teacher 역할을 맡긴다. hint 없는 student는 자기가 만든 trajectory 위에서 hint를 본 자신의 분포를 배운다. 07:52–10:21

on-policy self-distillation을 설명하는 발표 슬라이드
hint를 본 같은 모델을 teacher로 사용하는 구조. RLDR 본편 08:40의 실제 프레임.원본 장면 8:40

이 방식은 실제 task 분포에서 on-policy 샘플을 얻고, 하나의 rollout만으로도 teacher와 student를 비교하며, 전체 vocabulary의 log probability 차이를 token마다 신호로 줄 수 있다는 것이 화자의 주장이다. student가 뽑은 top token만 강화하지 않고, teacher가 더 적절하다고 본 다른 token들의 확률도 움직인다. 10:21–11:11

LiveCodeBench와 OpenClaw-RL 사례에서 화자는 짧은 과제와 작은 모델의 좋은 결과를 보고한다. 그러나 곧바로 이 결과를 120B 모델과 긴 tool-calling trajectory에 옮기면 문제가 생긴다고 전환한다. short-horizon 자체 보고와 범용 지속 학습의 증명은 같은 것이 아니다. 11:11–12:52

긴 trajectory에서는 작은 분포 차이가 ‘잠깐만’의 연쇄로 커진다

도구 호출이 수십 번에서 100번을 넘으면 초반의 작은 차이가 다음 관찰을 바꾸고, 그 관찰이 다시 다음 행동을 바꾼다. teacher와 student의 분포 차이가 긴 경로에서 누적될 수 있다. 발표는 대형 모델이 wait, but, maybe 같은 token을 반복하며 이미 맞는 경로를 의심하고 되돌아가는 현상을 but-wait problem이라고 부른다. 12:52–14:31

step-level divergence weighting은 모든 token 차이를 같은 크기로 학습하지 않는다. 각 도구 호출 단계에서 teacher와 student의 KL divergence를 보고, 의미 있는 차이가 큰 단계에 가중치를 둔다. 오류가 생긴 단계와 이후 복구 단계의 신호를 나누려는 것이다. 14:31–16:11

이 설명은 긴 trajectory의 핵심 특성을 보여 준다. 결과만 같아도 중간에 불필요한 도구 호출과 되돌리기가 많으면 비용과 실패 가능성이 커진다. 반대로 중간 분포 차이가 크다는 사실만으로 teacher가 옳다고 단정할 수도 없다. teacher가 본 hint 자체가 나쁘거나 실제 배포에서 얻을 수 없는 정보일 수 있기 때문이다.

좋은 힌트가 정답을 새면, 모델은 추론 경로를 건너뛴다

hint가 문제를 푸는 방향만 알려 주면 teacher가 더 나은 추론을 만들 수 있다. 하지만 정답이나 최종 행동이 섞이면 teacher는 중간 단계를 생략한다. student는 해결 과정보다 누설된 결과와 가까운 token 분포를 따라가게 된다. 발표는 이를 새로운 reward hacking인 hint leakage로 설명하고, LLM을 사용해 hint의 누설 여부를 거르는 방법을 제안한다. 16:11–17:51

hint leakage 문제를 설명하는 Ronak Malde 발표
정답이 섞인 hint가 중간 추론을 생략하게 만드는 실패 모드. RLDR 본편 16:20.원본 장면 16:20

공개 쇼츠는 본편과 원본이 같은 전체 영상 타임라인의 15:53.120–17:50.240을 쓴다. 쇼츠 제목의 ‘정답이 섞인 힌트’는 정확히 이 실패 모드를 가리킨다. 이 짧은 구간만으로 LLM 필터가 누설을 완전히 막는다고 결론 낼 수는 없다. 필터 모델도 애매한 paraphrase나 도메인 지식을 놓칠 수 있다.

residual guidance는 partial teacher와 full teacher의 신호를 선형 결합한다. 약한 hint는 문제 해결 방향을 주고, 강한 hint는 더 명확한 목표를 준다. 두 teacher의 차이를 residual로 사용해 분포 밖으로 지나치게 움직이는 것을 조절하려는 발상이다. 17:51–19:35

120B, 100회 도구 호출, RL 초과는 조건을 붙여 읽어야 한다

화자는 Nemotron 3 Super 120B와 Mercor APEX-Agents, 100회가 넘는 tool call에서 네 조건을 다시 충족했다고 주장한다. 회사의 Scaling SDPO 자료도 특정 조건에서 zero-shot 5% 대비 25%를 보고한다. 이 수치는 Trajectory의 자체 실험이며, task split, 비교군, hint 생성과 필터 조건을 함께 봐야 한다. 19:35–20:25

‘RL을 넘어섰다’는 표현도 범위를 좁혀야 한다. 특정 학습 예산과 환경에서 비교 방법보다 높은 점수를 얻었다는 주장과, 모든 강화학습을 대체했다는 주장은 다르다. self-distillation에도 environment, rollout, verifier와 업데이트 검증이 필요하다.

기술적 검증을 설계한다면 최소 네 묶음을 따로 기록해야 한다. 최종 task 성공률, trajectory 길이와 비용, hint 누설률, 기존 능력의 회귀다. 긴 과제에서 점수만 오르고 도구 호출 수가 폭증할 수 있다. 누설 필터가 강화될수록 유용한 hint까지 버릴 수 있다. 지속 학습은 새 행동 획득과 기존 행동 보존을 함께 평가해야 한다.

현재는 대부분 batch update와 재배포를 반복하는 단계다

Trajectory platform은 production agent trace를 받아 모델, harness, prompt와 agent loop를 함께 개선하는 제품 방향으로 소개된다. Q&A에서 ‘얼마나 continual한가’라는 질문이 나오자, 화자는 현재 업계가 데이터를 모아 offline batch update를 하고 새 모델을 다시 올리는 pseudo-continual learning에 가깝다고 인정한다. end-to-end 해법과는 거리가 있다는 답이다. 20:25–22:08

마지막 질문은 모델과 harness가 함께 바뀔 때 무엇을 기준으로 개선을 판단할지 묻는다. prompt와 도구가 바뀌면 같은 모델의 행동도 달라지고, 모델이 바뀌면 과거 trace의 의미도 달라진다. 화자는 이를 고객과 탐구 중인 미개척 문제로 남긴다. 22:08–23:03

이 발표의 값어치는 지속 학습이 끝났다는 선언보다, 확장하면서 깨지는 지점을 구체적으로 보여 주는 데 있다. single rollout에서 dense signal을 얻는 아이디어는 매력적이다. 동시에 긴 경로의 분포 drift, hint leakage, 회귀, model과 harness의 동시 변화가 새 평가 문제를 만든다. 배포 주기가 빨라졌다는 사실보다, 각 업데이트가 어떤 경험에서 나왔고 무엇을 개선하며 무엇을 망가뜨리지 않았는지 증명하는 체계가 더 중요하다.

더 읽을 자료

  1. AI Engineer 원본 발표
  2. AI Engineer 공식 발표 페이지
  3. Trajectory Scaling SDPO
  4. Self-Distilled Reasoner 논문