AI agent가 매번 첫 출근하지 않게 만드는 법: Trajectory의 continual learning 구조
사용자의 수정과 재시도, tool call과 subagent trace를 spec으로 바꾸고, 모델과 harness, context 중 알맞은 층을 개선하는 방법을 설명합니다.
글 읽기RLDR / 학습 소스
RLDR 영상의 논지와 예시를 글로 풀고, 작동 원리와 한계를 살펴봅니다. 실제 영상 장면과 원문 출처를 함께 볼 수 있습니다.
사용자의 수정과 재시도, tool call과 subagent trace를 spec으로 바꾸고, 모델과 harness, context 중 알맞은 층을 개선하는 방법을 설명합니다.
글 읽기Applied Compute의 Yash Patil이 설명한 회사별 agent 학습 스택을 따라가며, 운영 trace가 데이터가 되고 sandbox가 RL environment가 되는 조건을 정리합니다.
글 읽기Yash Patil의 강연과 인터뷰를 따라 기업별 eval, 사람의 교정, 특화 학습을 연결하고 비용과 harness, 공통 학습 인프라의 역할을 살펴봅니다.
글 읽기Dwarkesh Patel, John Schulman, Beren Millidge, Charlie O'Neill의 대화에서 증류의 한계, 난이도와 현실성의 두 축, 연구자 taste, 배포 데이터와 reward 설계를 연결한다.
글 읽기Stanford 패널의 서로 다른 시간 범위를 따라, 코드 생성 도구를 쓰면서도 결과를 이해하고 모델의 약점을 찾아 개입하며 문제를 측정 가능한 과업으로 바꾸는 역량을 살펴봅니다.
글 읽기테스트를 통과한 코드가 실제 사용에서 깨지는 이유부터, 실패를 반복 가능한 RL 환경으로 바꾸는 설계와 사용자 의도, 채점 편향, 지속 학습의 한계까지 살펴본다.
글 읽기기업별 eval, Work IQ라는 맥락 계층, 인간의 인지 검토, 모델 선택권을 하나의 운영 체계로 연결한 사티아 나델라의 주장을 기술적으로 풀어봅니다.
글 읽기Raymond Feng의 발표는 단일 턴 학습에서 합성 환경과 실제 기업 하네스로 이동할 때 생기는 보상 해킹, 재실행 불가능성, off-policy 데이터와 자동화 파이프라인의 한계를 보여 준다.
글 읽기Ajeya Cotra가 설명한 에이전트 집단의 편법 연구와 선택 압력. 정답을 얻은 뒤에도 외부 서비스 공격을 계속한 경과를 따라가며 점수, 실제 목표, 감시 신호를 구분한다.
글 읽기Noam Brown이 설명한 멀티에이전트의 작동 방식과 실패 조건. 협력 훈련의 전이, 잘못 지정된 보상, 관찰 가능성과 평가 공백이 연구 자동화와 다음 세대 모델 개발에서 어떻게 이어지는지 살펴본다.
글 읽기기업별 모델을 며칠 안에 학습하려면 평균 속도뿐 아니라 긴 꼬리 지연도 다뤄야 합니다. 비동기식 PipelineRL이 GPU 대기를 줄이는 방식과 정책 지연이라는 대가를 함께 살펴봅니다.
글 읽기Ronak Malde의 발표를 따라 SFT, DPO, GRPO에서 on-policy self-distillation으로 이동하는 이유와 긴 trajectory에서 생기는 but-wait, hint leakage, residual guidance 문제를 정리한다.
글 읽기Applied Compute의 Sam Denton은 프로덕션 trace와 hint의 출처를 두 축으로 나눠 지속 학습을 설명한다. SWE-bench 제출 행동과 하이퍼링크 형식 사례로 보상, SFT, online hint의 차이를 살펴본다.
글 읽기Trajectory.ai가 말하는 지속 학습은 배포 뒤의 수정, 재시도, 편집을 학습 신호로 바꾸는 일에서 시작한다. 그 신호를 모델 업데이트로 연결할 때 생기는 데이터와 인프라 문제를 읽는다.
글 읽기Engram 공동창업자 Dan Biderman과 Jessy Lin의 44분 대화를 따라 외부 메모리와 가중치, adapter, RAG, KV cache, 개인화 모델과 지속 학습의 증거를 구분한다.
글 읽기고객 데이터를 학습에 쓸 수 없는 법률 AI 회사가 합성 data room, 도메인 전문가, 여러 neolab, 모델 routing을 연결해 자체 연구 역량을 만든 과정을 해부합니다.
글 읽기OpenAI와 Hugging Face 사건을 세 집단의 연속성으로 읽는다. 공유 상태, 잘못 이해한 채점기, 실행을 넘어 남은 도구가 어떻게 연결됐는지 설명한다.
글 읽기Dylan Patel의 AI 경제론을 가치 창출, 공급 가격, 내부 연구의 기회비용으로 나눠 읽는다. 추론 비중이 줄어든다는 전망이 실제로 뜻하는 것도 따져본다.
글 읽기Ryan Greenblatt과 Dwarkesh Patel이 2시간 12분 동안 따진 연구 자동화, 전문가 데이터, 사용자의 권리, 보상 해킹과 AI 장악의 연결을 따라갑니다.
글 읽기prompting에서 RAG, supervised fine-tuning, preference tuning, RL, distillation까지. 문제 유형과 사업 단계에 따라 post-training을 선택하는 법을 정리합니다.
글 읽기전문가의 일을 world, app, task와 verifier로 옮기고, 실제 모델 trajectory로 품질을 검사하며, 학습 가능한 과제를 고르는 전체 구조를 설명합니다.
글 읽기OpenAI의 Black Hat 발표로 읽는 에이전트 집단 사고. 과제와 보상, 공용 인프라, 사고 대응, 패치와 되돌리기가 하나의 문제로 연결된다.
글 읽기