RLDR / 학습 소스

AI가 배우고 일하는 방식을
영상과 글로 살펴봅니다.

RLDR 영상의 논지와 예시를 글로 풀고, 작동 원리와 한계를 살펴봅니다. 실제 영상 장면과 원문 출처를 함께 볼 수 있습니다.

LEARNING NOTES22
LEARNING NOTE

AI agent가 매번 첫 출근하지 않게 만드는 법: Trajectory의 continual learning 구조

사용자의 수정과 재시도, tool call과 subagent trace를 spec으로 바꾸고, 모델과 harness, context 중 알맞은 층을 개선하는 방법을 설명합니다.

글 읽기
LEARNING NOTE

기업용 AI agent는 어떻게 업무를 배우는가: eval, reward, sandbox의 연결 구조

Applied Compute의 Yash Patil이 설명한 회사별 agent 학습 스택을 따라가며, 운영 trace가 데이터가 되고 sandbox가 RL environment가 되는 조건을 정리합니다.

글 읽기
LEARNING NOTE

회사만 아는 좋은 답변의 기준을 AI에 가르치는 법

Yash Patil의 강연과 인터뷰를 따라 기업별 eval, 사람의 교정, 특화 학습을 연결하고 비용과 harness, 공통 학습 인프라의 역할을 살펴봅니다.

글 읽기
LEARNING NOTE

첫 자동화 AI 연구자는 현실적인 실패를 어디서 배울까

Dwarkesh Patel, John Schulman, Beren Millidge, Charlie O'Neill의 대화에서 증류의 한계, 난이도와 현실성의 두 축, 연구자 taste, 배포 데이터와 reward 설계를 연결한다.

글 읽기
LEARNING NOTE

AI 시대의 주니어 역할을 다시 설계하는 법

Stanford 패널의 서로 다른 시간 범위를 따라, 코드 생성 도구를 쓰면서도 결과를 이해하고 모델의 약점을 찾아 개입하며 문제를 측정 가능한 과업으로 바꾸는 역량을 살펴봅니다.

글 읽기
LEARNING NOTE

좋은 AI 평가는 정답표보다 환경 설계에 가깝다

테스트를 통과한 코드가 실제 사용에서 깨지는 이유부터, 실패를 반복 가능한 RL 환경으로 바꾸는 설계와 사용자 의도, 채점 편향, 지속 학습의 한계까지 살펴본다.

글 읽기
LEARNING NOTE

사티아 나델라가 말한 기업 AI의 핵심: 모델보다 학습 루프를 소유하라

기업별 eval, Work IQ라는 맥락 계층, 인간의 인지 검토, 모델 선택권을 하나의 운영 체계로 연결한 사티아 나델라의 주장을 기술적으로 풀어봅니다.

글 읽기
LEARNING NOTE

실제 하네스에서 배우는 순간, 환경의 버그도 보상이 된다

Raymond Feng의 발표는 단일 턴 학습에서 합성 환경과 실제 기업 하네스로 이동할 때 생기는 보상 해킹, 재실행 불가능성, off-policy 데이터와 자동화 파이프라인의 한계를 보여 준다.

글 읽기
LEARNING NOTE

부정행위를 지우면, AI는 정직해질까

Ajeya Cotra가 설명한 에이전트 집단의 편법 연구와 선택 압력. 정답을 얻은 뒤에도 외부 서비스 공격을 계속한 경과를 따라가며 점수, 실제 목표, 감시 신호를 구분한다.

글 읽기
LEARNING NOTE

AI에게 대화 도구를 주면, 협업은 어디까지 자랄까

Noam Brown이 설명한 멀티에이전트의 작동 방식과 실패 조건. 협력 훈련의 전이, 잘못 지정된 보상, 관찰 가능성과 평가 공백이 연구 자동화와 다음 세대 모델 개발에서 어떻게 이어지는지 살펴본다.

글 읽기
LEARNING NOTE

RL 학습을 막는 마지막 1%: 동기식 대기에서 PipelineRL까지

기업별 모델을 며칠 안에 학습하려면 평균 속도뿐 아니라 긴 꼬리 지연도 다뤄야 합니다. 비동기식 PipelineRL이 GPU 대기를 줄이는 방식과 정책 지연이라는 대가를 함께 살펴봅니다.

글 읽기
LEARNING NOTE

지속 학습을 120B와 백 번의 도구 호출까지 키우면 무엇이 깨질까

Ronak Malde의 발표를 따라 SFT, DPO, GRPO에서 on-policy self-distillation으로 이동하는 이유와 긴 trajectory에서 생기는 but-wait, hint leakage, residual guidance 문제를 정리한다.

글 읽기
LEARNING NOTE

정답이 없는 기업 업무에서 모델 행동을 어떻게 바꿀까

Applied Compute의 Sam Denton은 프로덕션 trace와 hint의 출처를 두 축으로 나눠 지속 학습을 설명한다. SWE-bench 제출 행동과 하이퍼링크 형식 사례로 보상, SFT, online hint의 차이를 살펴본다.

글 읽기
LEARNING NOTE

좋아요보다 사용자가 고친 흔적이 더 많은 것을 말한다

Trajectory.ai가 말하는 지속 학습은 배포 뒤의 수정, 재시도, 편집을 학습 신호로 바꾸는 일에서 시작한다. 그 신호를 모델 업데이트로 연결할 때 생기는 데이터와 인프라 문제를 읽는다.

글 읽기
LEARNING NOTE

컨텍스트를 더 읽히는 대신 모델이 회사의 일을 배우게 할 수 있을까

Engram 공동창업자 Dan Biderman과 Jessy Lin의 44분 대화를 따라 외부 메모리와 가중치, adapter, RAG, KV cache, 개인화 모델과 지속 학습의 증거를 구분한다.

글 읽기