RLDR LEARNING NOTE

컨텍스트를 더 읽히는 대신 모델이 회사의 일을 배우게 할 수 있을까

Engram 공동창업자 Dan Biderman과 Jessy Lin의 44분 대화를 따라 외부 메모리와 가중치, adapter, RAG, KV cache, 개인화 모델과 지속 학습의 증거를 구분한다.

Sequoia Capital 대화 44분 52초 전체를 옮긴 RLDR 공개 본편을 다룬다. 100배 token 효율과 1,000배 압축은 Engram 또는 화자의 주장과 가설이며 독립 검증 사실이 아니다. 추가된 59.56초 쇼츠는 반복 검색과 캐시, 지식 내재화에 관한 대화다.

Always Training은 긴 프롬프트를 저장하는 기능보다 강한 주장이다

Engram이 내세우는 문제는 모델이 회사의 일을 할 때마다 같은 context를 다시 읽어야 한다는 데서 시작한다. 회사 문서, 팀의 관례, 사용자의 선호를 system prompt와 retrieval로 계속 공급하면 추론 비용이 늘고, 필요한 정보가 어느 문서에 있는지 찾는 일도 커진다. Jessy Lin과 Dan Biderman은 일부 context와 skill을 학습 과정으로 모델에 축적하는 방향을 ‘Always Training’으로 설명한다. 00:59–03:29

이 표현은 세 수준으로 나눠 읽어야 한다. 대화 기록을 저장하는 기능, 저장한 기록을 다음 요청에 검색해 넣는 기능, 경험을 가중치나 adapter 업데이트로 바꾸는 기능은 다르다. Engram의 핵심 주장은 세 번째에 있다. 실제 제품이 매 요청 직후 안정적으로 업데이트된다는 증명과는 거리가 있다. 회사도 여러 update를 거치는 continual learning을 열린 문제로 둔다.

영상은 Notion, Harvey, Microsoft를 early partner 또는 pilot 맥락으로 언급한다. 이것은 Engram이 관계와 방향을 그렇게 발표했다는 회사 자기보고다. 상대 회사가 모든 성능, 유료 계약, 배포 규모를 독립적으로 인증했다는 뜻은 아니다. 03:29–04:34

Base model 위의 adapter는 팀별 지식을 분리할 가능성을 연다

Engram은 강한 base model을 그대로 두고 adapter fine-tuning, SFT, RL, on-policy distillation 같은 방법을 조합해 팀의 context를 학습한다고 설명한다. adapter는 전체 모델을 팀마다 복제하지 않고 일부 파라미터만 갱신할 수 있게 한다. 04:34–05:32

적용할 수 있는 모델에도 조건이 있다. Dan은 비공개 가중치를 가진 기업과 협력하는 방식도 가능하지만, Engram이 직접 적용하기에는 오픈소스 모델이 가장 쉽다고 말한다. 학습 방법을 설계할 수 있다는 것과 특정 모델의 가중치에 접근해 실제로 갱신할 수 있다는 것은 별개의 문제다. 06:40

비공개 가중치 기업과의 협력 가능성과 오픈소스 모델의 적용 조건을 설명하는 Dan
Dan은 비공개 가중치 기업과 협력할 수도 있지만, 직접 적용하기에는 오픈소스 모델이 가장 쉽다고 설명한다. RLDR 본편 06:40.원본 장면 6:40

LoRA 원 논문은 base weights를 고정하고 low-rank trainable matrices를 추가하는 방식을 제시한다. LoRA 논문은 일반 기술의 존재와 조건별 효율을 확인하는 1차 자료다. Engram이 동일한 구조와 성능을 사용한다는 증거는 아니다. Prefix-Tuning도 작은 continuous prefix를 학습하는 별도 접근이며, 영상에서 ‘adapter’라고 부르는 모든 구현을 한 방식으로 환원할 수 없다.

팀별 adapter는 기술적 격리만으로 충분하지 않다. 회사 공통 지식과 개인 skill, 민감한 문서와 이동 가능한 업무 습관을 어떤 층에 둘지 정해야 한다. 직원이 팀을 옮기거나 접근 권한이 사라졌을 때 adapter에서 무엇을 삭제할지, base model 업데이트 뒤에도 기존 adapter가 유효한지 검증해야 한다. 영상 후반의 개인화 비전은 이 권리 문제를 해결한 제품 사양이 아니라 장기 방향이다.

무엇을 가중치에 넣고 무엇을 외부 메모리에 남길지는 아직 열린 문제다

모든 정보를 모델에 내재화하는 것이 답은 아니다. 최신 가격이나 계약 상태처럼 정확한 출처와 즉시 갱신이 중요한 사실은 외부 저장소가 유리하다. 반복적으로 쓰는 회사 관례나 문서 triage skill은 weights나 adapter에 익혀 추론 때마다 긴 context를 읽지 않게 할 수 있다. 영상은 이 경계를 명확한 정답이 없는 설계 문제로 남긴다. 05:32–06:49

RAG 원 논문은 pretrained parametric memory와 검색 가능한 non-parametric memory를 결합한다. RAG 논문은 외부 지식의 접근과 갱신 문제를 설명하지만, Engram 제품이 RAG보다 우월하다는 증명이 아니다. 영상의 ‘RAG killer’ 같은 표현은 화자의 수사로 읽어야 한다. 24:44–28:48

반복 검색의 문제를 더 구체적으로 설명하는 대목도 있다. 같은 질의 안에서, 또 같은 회사의 여러 직원이 같은 문서를 거듭 읽는다면 모델이 이미 알고 있어야 하는 것 아니냐는 질문이다. 직원이 어제 하던 일을 매번 검색창에 물어보지는 않는다는 비유가 이어진다. 진행자가 캐시로 해결할 수 있지 않느냐고 묻자, 화자는 어느 정도는 그렇다고 인정한다. 반복 검색과 캐시에 관한 대화는 본편 28:32–28:55에 나온다.

이후의 주장은 검색 비용을 아끼는 데서 더 나아간다. 팀원이 어떤 연구를 하는지 보고, 따로 묻지 않았어도 관련 지식을 떠올려 알려 주는 모델을 원한다는 것이다. 화자는 그런 연관이 가중치에서만 생길 수 있다고 본다. 기존 지식 위에 새 지식을 쌓는다는 설명은 28:54–29:32에 이어진다. 다만 이 대화는 RAG, 캐시, 가중치 학습을 동일한 과업에서 비교한 실험을 제시하지 않는다. 연관을 떠올리는 능력이 오직 가중치 학습에서만 가능하다는 결론은 화자의 주장으로 남겨야 한다.

기술적으로는 정보의 성격에 따라 경계를 세울 수 있다. 자주 반복되며 느리게 변하는 skill, 정확한 출처보다 행동 패턴이 중요한 지식은 내재화 후보가 된다. 빠르게 변하고 권한과 삭제 요구가 강하며 인용이 필요한 사실은 외부 메모리에 남기는 편이 검증하기 쉽다. 이 분류는 본문의 해석이다. 실제 시스템에서는 두 저장 방식 사이에 출처와 변경 이력을 남기고, 서로 충돌하는 정보의 우선순위를 정해야 한다.

이 59.56초 쇼츠는 같은 회사 문서를 반복해서 읽는 문제, 캐시가 일부 해결할 수 있다는 답변, 요청하지 않은 연관 지식까지 떠올리려면 내재화가 필요하다는 화자의 주장을 담는다. 쇼츠 전체 구간

100 tokens와 100,000 tokens의 대비는 benchmark 결과가 아니라 가능성 예시다

Dan은 회사 context를 매번 긴 prompt로 읽히는 대신 학습해 두면 추론 token을 두 자릿수 배 줄일 수 있고, 특정 작업에서는 최대 100배 효율도 가능하다고 주장한다. 한 예시에서는 같은 답에 100 tokens를 쓰는 모델과 100,000 tokens를 쓰는 frontier model을 대비한다. 두 숫자는 동일한 데이터셋과 평가 조건에서 나온 평균 결과가 아니다. 06:49–08:19

Engram의 공식 소개 글도 내부 사용과 Notion design partnership에서 10배 또는 100배 token 효율을 회사가 관찰했다고 발표한다. Engram 소개 글은 회사가 무엇을 주장하는지 확인하지만, task, 비교 모델, token 정의, 통계와 원시 결과가 공개된 독립 benchmark는 아니다.

token 절감과 task 성능도 분리해야 한다. 긴 context를 덜 읽고 같은 품질을 내면 비용과 지연이 줄 수 있다. 그러나 중요한 문서를 빼고 짧게 답했다면 token은 줄어도 정확성이 떨어진다. 효율 주장은 입력과 출력 token, 캐시 사용량, 학습 비용, 실패 재시도까지 포함한 전체 비용과 함께 봐야 한다.

암기와 이해를 나누는 순간에도 어떤 일반화를 원하는지 정해야 한다

대화는 팀별 모델에서 개인별 모델로 확장된다. 사람마다 읽은 문서와 일한 방식이 다르므로, 하나의 범용 모델보다 개인 또는 팀에 맞춘 모델이 더 유용할 수 있다는 전망이다. 이어 암기와 이해의 차이를 묻는다. 회사 문서를 그대로 기억하는 능력과, 그 문서에서 얻은 규칙을 새 상황에 적용하는 능력은 같지 않다. 08:19–12:47

학습 데이터에 특정 문장을 반복하면 회상률은 높아질 수 있다. 그러나 문서가 바뀌었을 때 낡은 답을 고집하거나, 다른 부서의 규칙을 잘못 일반화할 수 있다. 지속 학습 eval은 단순 recall과 transfer, 업데이트 뒤의 수정, 기존 능력 보존을 각각 측정해야 한다.

화자들은 인간이 잠을 자며 경험을 소화하는 과정에 빗대어, 모델도 상호작용 뒤 offline compute로 context를 통합할 수 있다고 상상한다. ‘꿈’은 설계 직관을 주는 비유다. 모델이 인간과 같은 생물학적 기억 과정을 가진다는 사실이나, Engram이 이미 동일한 통합 메커니즘을 구현했다는 뜻은 아니다. 12:47–14:08

모든 경험을 저장하는 것보다 무엇을 배우지 않을지 정하는 일이 중요하다

Jessy는 사람이 미리 완벽하게 큐레이션한 데이터만 기다리지 않고 실제 상호작용에서 학습하는 방향을 말한다. 여기에는 중요한 긴장이 있다. 현실 데이터는 풍부하지만 실수, 우연, 민감 정보, 서로 충돌하는 취향도 함께 들어 있다. 큐레이션을 줄이는 것이 검증을 없애는 일은 아니다. 14:08–15:19

영상은 장기적으로 모든 개인과 팀이 자기 모델을 가질 수 있다는 비전을 펼친다. Frontier Lab이 하나의 강한 범용 모델을 만드는 방향과, Engram이 많은 context-specific model을 상정하는 방향을 대비한다. 수억 개의 개인화 모델이나 100조 파라미터 같은 표현은 전망과 농담을 포함한다. 현재 배포 수나 시장 규모로 읽어서는 안 된다. 15:19–21:44

개인화가 많아질수록 평가도 분산된다. 한 사람의 선호를 잘 맞추는 변화가 회사 정책을 위반할 수 있고, 팀에서 유용한 skill이 다른 팀에서는 잘못된 행동이 될 수 있다. 공통 base, 회사 adapter, 팀 adapter, 개인 memory를 나눌 때 각 층의 접근 권한과 삭제 기준, 다른 층에 반영할 조건이 필요하다. 한 사람의 선호를 회사 전체의 규칙으로 적용해서는 안 된다.

Bitter Lesson은 학습을 늘리라는 방향이지 모든 메모리를 weights에 넣으라는 명령이 아니다

대화는 Rich Sutton의 Bitter Lesson을 불러와 사람이 설계한 복잡한 규칙보다 계산과 학습을 확장하는 방법이 장기적으로 우세했다는 역사적 관점을 말한다. Engram은 더 많은 inference context보다 새 context에 training compute를 쓰는 방향을 여기에 연결한다. 21:44–24:44

그러나 architecture 선택에는 trade-off가 남는다. 표준 attention은 sequence length가 늘면 계산량이 빠르게 커지고, state-space나 sparse attention 계열은 이를 줄이려 한다. Dan은 자신의 경험을 바탕으로 memory와 accuracy 사이의 손실을 말하지만, 모든 sub-quadratic model이 반드시 정확도를 희생한다는 정리는 아니다.

학습 compute를 늘리는 방향도 데이터 권리와 망각 문제를 자동으로 풀지 않는다. 모델이 더 잘 압축할수록 원본 사실을 어느 update에서 배웠는지 추적하기 어려워질 수 있다. training이 retrieval보다 싸다는 주장도 update 빈도, adapter 크기, 검증과 rollback 비용을 포함해야 한다.

80GB KV cache와 1,000배 압축은 조건부 계산과 가설이다

후반부에서 Dan은 Wikipedia 한 편을 긴 context로 넣을 때 KV cache가 약 80GB가 될 수 있고, 70B LLaMA weights가 약 100GB라는 대략값을 비교한다. 이어 지식을 weights나 learned representation으로 옮기면 cache를 1,000배 작게 만들 가능성을 제시한다. 모델 버전, 정밀도, sequence length, KV head 구조와 batch가 빠져 있어 보편 수치로 쓸 수 없다. 24:44–31:38

RAG와 모델 가중치의 memory 역할을 비교하는 대화 화면
무엇을 내재화하고 무엇을 외부 memory에 남길지 논의하는 실제 프레임. RLDR 본편 25:10.원본 장면 25:10

관련 연구인 Cartridges는 corpus별 KV cache를 offline self-study로 학습하는 별도 접근을 제시하고, 특정 장문 benchmark에서 ICL 대비 38.6배 적은 memory와 26.4배 높은 throughput을 보고한다. Cartridges 논문의 조건과 영상의 1,000배 가설은 서로 다른 숫자다. 합쳐서 Engram의 성능으로 표현하면 안 된다.

압축에는 검증 손실이 따른다. 외부 문서라면 사용자가 원문을 열어 확인하고 최신 버전으로 교체할 수 있다. weights 안의 지식은 어느 문장에 대응하는지 직접 보기 어렵다. 따라서 memory 효율뿐 아니라 사실 수정률, 출처 회수, 충돌 시 우선순위, 삭제 후 잔존 행동을 함께 평가해야 한다.

지속 학습의 첫 설득력 있는 장면은 다음 날 실제로 나아진 모델이다

화자들이 기다리는 proof of concept은 사용자가 모델을 가르치고, 다음 날 같은 종류의 일을 더 잘하는 장면이다. 긴 context를 다시 붙였기 때문이 아니라 학습으로 행동이 개선됐음을 보여 주어야 한다. 회사는 daily, hourly, 장기적으로 minute 단위 retraining을 목표로 말하지만, 업데이트 빈도와 학습 효과는 다른 지표다. 31:38–33:17

공개 쇼츠는 본편 31:38.520–32:20.530을 사용하며 ‘어제보다 나아졌네’라는 기대를 담는다. 쇼츠의 context note도 이를 이미 달성한 성과가 아니라 기다리는 증명으로 한정한다. 영상 속 시연이나 benchmark가 이 기대를 입증한 것은 아니다.

continual learning의 최소 증거는 네 가지다. 같은 분포의 미래 task가 좋아지고, 기존 task가 무너지지 않으며, 새 지식이 옛 지식과 충돌할 때 정정되고, 허용되지 않은 경험은 학습에서 제외되거나 삭제된다. 개인과 팀의 모델이 늘어날수록 어느 update가 누구의 권한으로 만들어졌는지도 필요하다.

회사를 옮길 때 무엇을 기억에 담아 가져갈 수 있을까

후반의 짧은 문답에서 Dan은 GitHub Copilot과 ChatGPT를 큰 전환점으로 꼽는다. 코딩 agent의 발전을 체감했지만, 개인과 경제에 쓸모가 있으면서도 해를 만들지 않는 방식으로 모델이 스스로 바뀌는 장면은 여전히 기다리고 있다고 말한다. 지속 학습을 이미 끝난 제품 기능보다 다음에 보고 싶은 변화로 보는 대목이다. 33:17–34:24

진행자 Sonya Huang은 여러 앱과 직장을 옮겨 다닐 때 함께 가져가는 ‘메모리 지갑’을 상상한다. Jessy는 모든 기억을 한데 모으는 방향에 곧바로 동의하지 않는다. 개인 생활과 업무의 맥락은 분리하고 싶다는 것이다. 지난주 GPU에서 모델을 훈련한 일이 오늘 침구를 고르는 대화에 끼어든다면 기억은 편의보다 방해가 된다. 메모리의 양뿐 아니라 언제 어느 기억을 쓰지 않을지 통제하는 제품 형태가 필요하다는 주장이다. 34:26–35:18

Dan은 회사의 지식재산은 회사에 남기되, 직원이 배운 기술과 일하는 방식 중 일부는 다음 직장에 가져갈 수 있으면 좋겠다고 덧붙인다. 사람이 경험을 가지고 이직하듯 디지털 기술 묶음도 이동할 수 있다는 비전이다. 다만 다른 회사의 지식재산을 해치지 않도록 정제한다는 조건이 붙는다. 이 대화는 그 분리 알고리즘이나 계약 모델이 해결됐다고 말하지 않는다. 35:24–36:08

그는 사람이 기술을 몸에 익힌 채 이직하고 비밀유지 약정과 윤리 규범을 따르는 모습을 비유로 든다. 디지털 기술도 이렇게 이어 갈 수 있다면, 회사와 일상에서 AI를 더 깊이 쓰고 새로운 방법을 만드는 노력이 보상받을 수 있으리라고 기대한다. 기술 이전이 구현됐다는 보고가 아니라, 사람들이 AI 활용을 더 발전시키게 할 유인에 대한 전망이다. 쇼츠 00:26–00:43

기술적으로는 기억을 내보내는 파일 형식보다 경계 설정이 어렵다. 반복해서 쓰는 일반 기술과 특정 고객 문서에서만 나온 사실이 한 adapter에 섞일 수 있기 때문이다. 어떤 기억이 행동에 영향을 줬는지 추적하고, 내보내기 전후에 원래 회사의 사실이 재현되는지 검사할 수 있어야 한다. 개인화 모델이 생겼다고 해서 그 안의 지식을 모두 개인 소유로 볼 수는 없다. 이는 인터뷰의 비전을 구현할 때 생기는 추가 설계 문제다.

직장을 옮길 때 AI가 배운 기술을 가져가는 가능성을 설명하는 장면
회사의 지식재산은 남기고, 정제된 기술과 일하는 방식 일부만 다음 직장으로 옮길 수 있을지 묻는 대목이다. 부모 영상의 실제 프레임이며 이 Short의 원본 구간에 해당한다.원본 장면 35:38.7

언어가 앞선 이유를 시각의 정보량만으로 설명할 수 있을까

Shaun Maguire는 2012년 AlexNet 이후 한동안 시각 연구가 앞서던 흐름과 최근 언어 모델의 발전을 대비한다. 언어가 이렇게 강해진 것이 놀랍지 않은지, 시각이 다시 중요한 축이 될지 묻는다. Jessy는 언어가 복잡한 추상 개념을 전달하는 매체라는 점을 강조하면서, 장기적으로 언어와 시각이 여러 입력을 함께 이해하는 시스템으로 결합할 것이라 예상한다. 36:08–37:23

Dan은 원래 세상을 보고 행동하는 경험이 지능의 핵심이 될 것이라 생각했다고 말한다. ChatGPT 이후에는 언어 모델이 실제로 어떻게 만들어지는지 배우게 됐고, 문자로 표현된 정보에서도 큰 능력이 나오는 점을 인상적으로 봤다고 설명한다. 그렇다고 이미지와 영상에 남은 가능성이 사라진 것은 아니라는 견해다. 이 부분은 두 연구자의 경험과 전망이며 특정 모델 비교 실험은 아니다. 37:23–38:41

이어 Shaun은 생물학적 시각의 입력 정보량과 컴퓨터의 전자적 처리를 연결하는 가설을 제시한다. 사람에게는 시각 입력이 풍부하지만 컴퓨터 안에서는 시각과 언어가 모두 전자적으로 처리되므로 상대적 조건이 달라졌을 수 있다는 생각이다. 그는 여러 차례 자신이 생물학자가 아니며 거친 개인 추측이라고 한정한다. 이를 언어 모델의 성공 원인이 밝혀졌다는 설명으로 읽어서는 안 된다. 입력 정보량, 데이터의 구조, 학습 목적, 모델 구조는 각각 검토해야 할 변수다. 38:41–41:07

Dan의 답도 단순한 동의가 아니다. 인간은 시각에 치우쳐 있지만, 그 사실만으로 어떤 표현을 더 효율적으로 학습할지 결정되지는 않는다고 말한다. 문서를 읽고 메모를 쓰는 현대 지식 노동에서는 텍스트가 충분히 유용할 수 있다. 뇌에 신호를 되돌려 주는 인터페이스를 만들 때와 사무 업무를 돕는 모델을 만들 때는 서로 다른 설계 질문을 던져야 한다는 것이다. 41:16–42:46

개인화 모델은 파일 시스템을 읽는 새로운 인터페이스가 될까

마지막 질문은 모든 일이 잘 풀렸을 때 5년, 10년 뒤의 모습을 묻는다. Jessy는 사람마다, 팀마다 다른 목적에 맞춘 모델이 생기고, 범용 모델과도 다르게 작동하는 지능이 곳곳에 있는 미래를 그린다. 개인을 안다는 말에서 더 나아가 그 개인에게 맞는 방식으로 실제 도움을 주는 모델이 목표다. 42:46–43:24

Dan은 Engram을 데이터에 접근하는 LLM 인터페이스로 상상한다. Databricks나 Oracle이 데이터 활용의 기반을 제공하듯, 개인화된 모델과 학습된 기억이 각자의 데이터 위에 놓일 수 있다는 비전이다. 원래 파일 구조를 그대로 흉내 내기보다 그 정보 사이의 연관과 쓰임을 학습한 표현을 만들겠다는 방향이다. 수억 개의 모델이라는 규모도 이 미래상에 속하며 현재 제품 보급 수가 아니다. 43:24–44:14

여기서 ‘신경 인터페이스’는 문맥상 데이터와 학습된 모델을 연결한다는 비유다. 앞서 잠깐 나온 뇌-컴퓨터 인터페이스를 Engram의 현재 하드웨어 제품으로 오해하면 안 된다. 모델이 파일을 얼마나 압축했는지와, 필요한 사실을 정확히 찾고 새 상황에서 올바르게 쓰는지는 서로 다른 성능이다.

이 대화를 실무의 질문으로 옮기면 세 가지가 남는다. 반복되는 경험 가운데 무엇을 학습할지, 그 경험을 누구의 모델에 남길지, 업데이트 뒤 어떤 일을 더 잘하게 됐는지다. 긴 컨텍스트를 덜 읽는 효율에서 출발한 논의가 기억의 적용 범위와 이동 가능성까지 이어지는 이유다.

더 읽을 자료

  1. Sequoia Capital 원본 영상
  2. Sequoia Capital 공식 대화 페이지
  3. Engram 공식 소개
  4. Retrieval-Augmented Generation 논문
  5. LoRA 논문
  6. Cartridges 연구