#RLDR / DEEP DIVE 01
기업은 모델이 아니라 학습 루프를 소유한다.
Applied Compute는 API 하나를 판매하는 회사가 아니다. 고객의 업무 환경과 평가 기준, 문맥, 운영 데이터를 모델 학습에 계속 연결하는 공정을 제공한다.
#RLDR / 전체 압축본
Applied Compute는 기업별 모델보다 기업별 학습 공정을 만든다.
Applied Compute는 2026년 4월 회사 발표를 기준으로 누적 1억 6,000만 달러를 투자받았고, 당시 post-money 기업가치는 13억 달러였다. 회사는 이 자금으로 또 하나의 foundation model을 만들기보다, 기업마다 자체 모델과 agent workforce를 운영할 수 있는 model factory를 만들겠다고 밝혔다.
- 01
Specific Intelligence는 weights와 실행 문맥에 함께 존재한다.
Applied Compute는 Specific Intelligence가 weights와 runtime context에 존재한다고 설명한다. 실제 제품을 이해하려면 여기에 agent harness, grader, 운영 피드백까지 포함해야 한다. 단순히 회사 문서를 더 많이 넣는다는 뜻이 아니다.
- 02
기업 데이터의 핵심은 문서의 양보다 판단 기준이다.
모델이 낸 결과를 평가할 수 없으면 RL은 업무를 배우지 못한다. 잘못 설계한 reward가 있다면, 모델은 잘못된 행동을 더 효율적으로 최적화한다. DoorDash의 메뉴 품질 관리와 Cognition의 코드 리뷰 사례가 이 주장을 구체적으로 보여준다.
- 03
사업은 pure SaaS보다 model factory에 가깝다.
Applied Compute는 AC2, dedicated inference, Embedded와 Managed delivery를 함께 제공한다. Forward-deployed engineer와 연구자가 고객 엔지니어와 함께 모델을 학습하고 제공하며 개선한다. 다만 서비스 매출의 비중과 가격은 공개하지 않았다.
- 04
배포 뒤에 생기는 기록을 다음 학습에 활용한다.
AC2는 운영 과정에서 생긴 trace를 failure analysis, data generation, self-distillation, 다음 training run의 신호로 활용하도록 설계됐다. 실제 traffic이 다음 checkpoint의 재료가 될 수 있다는 뜻이지, 모든 고객 모델이 자동으로 갱신된다는 뜻은 아니다.
- 05
경쟁력은 model access가 아니라 feedback loop에서 나온다.
Frontier API는 여러 기업이 같은 조건으로 구매할 수 있다. 그러나 같은 업무를 실행하고, 결과를 재현하며, 전문가의 판단을 reward로 바꾸는 과정은 회사마다 다르다. 이것이 Applied Compute가 제시하는 가장 강한 주장이다.
SPECIFIC INTELLIGENCE / DEFINED
Specific Intelligence란 회사의 판단을 소유 가능한 모델 행동으로 바꾸는 체계다.
Applied Compute의 공개 설명과 제품을 함께 읽으면, 이 체계는 다음 다섯 요소로 구성된다.
WEIGHTS + CONTEXT + HARNESS + EVALS + FEEDBACK
- 01 / WEIGHTS
- 회사가 소유하는 specialized modelOpen-weight base model을 특정 task에 맞게 post-train한다. Foundation model을 처음부터 만든다는 뜻은 아니다.
- 02 / CONTEXT
- 계속 갱신되는 조직의 기억Context Engine은 문서, SaaS, 과거 작업, agent trace를 Remember, Refine, Retrieve하는 역할을 맡는다.
- 03 / HARNESS
- 모델이 실제로 일하는 환경Filesystem, tool, state, sandbox, permission, memory가 여기에 들어간다. Reset 기능은 같은 조건을 재현하려는 학습 환경에 필요하다.
- 04 / EVALS
- 결과가 좋은지 판별하는 기준Test, rubric, human preference, business outcome을 reward로 바꾼다. 잘못된 grader는 reward hacking을 유발할 수 있다.
- 05 / FEEDBACK
- 배포 뒤에 생기는 경험실제 trace와 feedback을 다음 학습과 문맥 개선에 활용할 수 있다. 이를 누적되는 자산으로 보는 관점은 회사가 제시한 전략적 주장이다.
BUSINESS / TECHNOLOGY / FUTURE
사업, 기술, 미래를 한 문장으로 섞지 않았다.
- BUSINESS
- 플랫폼과 연구, 운영 서비스를 함께 제공한다.AC2가 train, serve, improve를 연결하며, FDE와 연구자가 고객 현장에 참여한다. 공개 가격과 매출 구성은 알 수 없다.
- TECHNOLOGY
- 모델과 문맥, harness를 함께 최적화한다.Async RL, rollout observability, BYO Harness, dedicated inference, Context Engine을 하나의 model factory로 묶는다.
- FUTURE
- 각 기업이 자체 agent workforce와 학습 루프를 소유한다.회사가 제시한 미래상이다. 모든 상호작용에서 자동으로 개선되는 완전 자율 agent는 아직 검증된 제품 상태가 아니다.
EVIDENCE BOUNDARY
회사 발표에서 확인한 결과와 회사가 그리는 미래를 구분했다.
- REPORTED
- 30%DoorDash의 중요 메뉴 오류 감소 기준선 대비 상대 감소율이다. 미국 전체 메뉴 traffic에 배포했고 1,000시간 이상을 절약했다는 내용도 회사 case study가 보고했다.
- REPORTED
- 10×Cognition의 bug detection 속도 Windsurf Quick Review의 특정 harness에서 보고된 개선이다. 모든 code review benchmark에서 우위를 보였다는 뜻은 아니다.
- REPORTED
- +16.9%APEX Contextbase의 상대 개선 Mercor의 APEX-Agents 외부 benchmark 208개 과제를 Applied Compute의 harness로 평가한 회사 실험이다. GPT-5.4 medium은 44.2%에서 51.7%로 올랐고, 절대 개선 폭은 7.5%p였다.
- VISION
- ∞Deploy once, learn forever 모든 interaction에서 스스로 학습하는 agent는 회사가 제시한 방향이다. 현재 모든 고객에게서 검증된 기능은 아니다.
RELATIONSHIPS / WHAT ACTUALLY HAPPENED
Harvey와 Satya Nadella의 사례도 공개 근거 안에서만 해석했다.
HARVEY TENET
Harvey Tenet의 trainer는 Applied Compute가 아니다.
Harvey는 Tenet 본체인 Kimi K3의 post-training을 Harvey와 Fireworks Research가 수행했다고 설명했다. Applied Compute는 별도 Review Table 모델의 공동 파트너이며, Tenet 연구의 acknowledgement에도 파트너로 언급됐다. 두 프로젝트의 역할을 합쳐서는 안 된다.
Harvey Tenet 원문 ↗SATYA NADELLA / 32:40
“There should be as many models in the world as there are firms.”
Applied Compute는 Yash Patil과 Satya Nadella가 enterprise AI와 model ownership을 논의한 32분 40초 분량의 fireside chat을 공식 YouTube에 공개했다. 공식 podcast feed에 올라온 회차라기보다 긴 대담이다. Satya Nadella의 참여는 공개적인 관계와 영향력을 보여주는 신호지만, 공개 자료만으로 Microsoft의 투자나 독점 제휴를 확인할 수는 없다.
Satya Nadella 대담 보기 ↗THE STRONGEST COUNTERCASE
Specific Intelligence의 차이는 새 알고리즘보다 통합 운영에 있다.
Fine-tuning, RAG, context engineering, agent orchestration, 평가 인프라, managed deployment는 이미 존재한다. Applied Compute의 차별점은 완전히 새로운 기법 하나가 아니라, 이 요소를 고객 업무 안에서 하나의 학습 과정으로 묶는 실행력에 있다.
이 강점은 동시에 비용 요인이 될 수 있다. 고객마다 환경과 grader를 만들고 FDE가 참여해야 한다면, 인력과 infrastructure 비용도 고객 수에 따라 늘어날 수 있다. Reward가 틀리면 모델은 잘못된 행동을 더 효율적으로 학습한다. 공개 case study만으로는 gross margin, 장기 retention, 독립 재현성을 판단할 수 없다.
그래도 방향은 분명하다. 범용 모델 경쟁 다음에는 각 회사가 자기 업무의 학습 과정을 얼마나 잘 소유하는지를 두고 경쟁하게 될 가능성이 크다.
WATCH + READ / 5 VIDEOS
영상의 흐름은 유지하고, 자막의 오류는 1차 자료로 교정했다.
각 글은 영상 전체 자막의 전개를 보존해 압축했다. 왼쪽 영상 목록에서 한 편을 고를 수 있고, 본문의 주황색 타임코드를 누르면 플레이어가 정확한 지점부터 재생된다.
VIDEO 01 / 20:19
Efficient Reinforcement Learning
#RLDR / 압축본
기업별 RL에서는 알고리즘 자체보다 느린 rollout과 비효율적인 GPU 배치가 더 큰 병목이 될 수 있다.
- Applied Compute가 말하는 enterprise RL은 한 번의 거대한 training run으로 끝나지 않는다. 고객마다 다른 업무를 며칠 안에 학습하고, 비용과 완료 시간을 예측할 수 있는 반복 생산 체계가 필요하다.
- 일부 응답이 지나치게 길어지면 straggler가 되어 전체 batch의 완료를 늦춘다. 샘플링과 학습을 비동기로 분리하면 GPU의 유휴 시간을 줄일 수 있지만, 오래된 policy로 만든 rollout이 쌓이면서 staleness가 생긴다.
- 따라서 이 발표에서 중요한 제품 요소는 새로운 RL algorithm보다 scheduler다. 이 scheduler는 sampling GPU와 training GPU의 비율, KV cache, queue, 허용할 staleness를 함께 최적화한다.
- 발표 마지막에 제시된 60% speed-up은 production 환경에서 측정한 값이 아니라 조건을 설정한 simulation 결과다. 이 수치를 해석하려면 hardware와 response distribution, staleness limit도 함께 확인해야 한다.
FULL NOTES / 전체 자막 기반
연구소의 RL을 고객별 생산 공정으로 바꾼다
발표는 회사마다 expert model이 필요하다는 문제의식에서 시작한다. Applied Compute는 OpenAI에서 공용 benchmark를 최적화하는 데 쓰던 RL을 기업의 private benchmark로 확장한다고 설명한다. 범용 모델이 익숙하지 않은 OOD 업무를 고객의 실제 분포에 맞추고, 운영 과정에서 생긴 사용 기록을 다시 학습 신호로 활용하려는 것이다. 발표자는 수학 문제 네 개를 각각 100번 풀게 하는 단순한 예시를 먼저 보여주지만, 실제 목표는 메뉴 검수, 코드 리뷰, 고객 지원처럼 기업마다 다른 업무를 학습하는 데 있다.
Frontier lab은 하나의 training run에 몇 주를 사용할 수 있다. 그러나 고객별 학습에서는 며칠 안에 결과를 전달해야 하며, GPU 비용과 완료 시간의 편차도 함께 낮춰야 한다. Applied Compute가 RL을 연구 기법만이 아니라 운영 제품으로 보는 이유다.
마지막 1%의 응답이 전체 GPU를 세운다
동기식 RL에서는 batch에 포함된 모든 rollout이 끝나야 다음 학습 step으로 넘어간다. 발표자가 제시한 Qwen-30B 내부 측정에서는 산술 문제 40개마다 32개 샘플을 요청했을 때 99%가 약 40초 안에 끝났지만, 마지막 1%를 기다리는 데 추가로 80초가 걸렸다. Checkpoint, hardware, sampling 설정을 공개하지 않았으므로, 이 수치는 재현 가능한 benchmark가 아니라 straggler를 설명하는 내부 사례로 읽어야 한다.
PipelineRL은 sampling GPU와 training GPU를 분리한다. 완료된 rollout은 queue에 들어가고, trainer는 필요한 batch가 모이는 즉시 학습을 시작한다. In-flight weight update는 샘플을 생성하는 중에도 weights를 갱신하지만, worker가 새 weights를 받는 동안 inference가 잠시 멈춘다. 따라서 sampling workers never stop이라는 표현은 지속적으로 실행한다는 요약이지, 문자 그대로 중단이 전혀 없다는 뜻은 아니다.
더 빠른 비동기는 더 오래된 데이터를 만든다
비동기 학습은 staleness라는 대가를 치른다. 하나의 샘플 안에 policy t, t+1, t+2가 만든 token이 섞일 수 있으며, t+3이나 t+4에서 학습할 때에는 token마다 staleness가 달라질 수 있다. 허용치를 2나 1로 낮추면 필요한 sample을 기다리는 동안 training worker가 다시 쉬게 된다. Rollout을 만든 behavior policy와 현재 target policy가 다르므로 importance ratio로 차이를 보정하지만, 이 방법이 정확하려면 확률비와 support 조건이 필요하다. Clipping, truncation, 근사 ratio를 사용하면 bias가 남을 수 있다.
발표의 시스템 모델은 GPU 예산, training batch size, sampling latency, training GPU당 throughput을 입력으로 받는다. Sampling 과정에서는 KV cache의 영향으로 memory-bound 구간과 compute-bound 구간이 달라진다. 발표자는 roofline 형태의 latency curve를 사용해 동시 요청 수가 늘어날 때 처리량이 어느 지점에서 꺾이는지 추정한다.
최적 GPU 비율은 고정값이 아니다
발표 후반에는 simulator를 구성한다. 실제 response-length distribution을 입력해 synchronous batch가 처리되는 과정을 재현하고, asynchronous queue에서는 샘플 생산률과 trainer 소비율이 균형을 이루는 상태를 찾는다. Training GPU를 지나치게 많이 배치하면 queue가 비고, sampling GPU를 지나치게 많이 배치하면 queue의 길이와 staleness가 함께 커진다.
발표자는 최대 staleness, KV cache, 가장 긴 요청 시간, training step time을 제약 조건으로 두고 가능한 layout을 비교한다. 약 60% speed-up은 이 조건에서 얻은 simulated result다. 영상 자막에 나온 throughput 식은 차원상 잘못 해석될 수 있다. Batch latency를 기준으로 한 처리량은 batch size를 latency로 나눈 값이나 tokens per second로 표현해야 한다.
TRANSCRIPT FIX / 사실 교정
자막을 그대로 인용하지 않은 이유
- 자동자막에 나온 GPOSS는 GPT-OSS로, RO/R0 training은 RL training으로, stillness는 staleness로 교정했다.
- 자동자막에 나온 highMP compute RL은 high-compute RL 또는 compute-intensive RL로 교정했다.
- Importance sampling은 필요한 조건을 만족할 때에만 unbiased 보정을 제공한다. 근사와 clipping을 적용하면 bias가 생길 수 있다.
- Sampling throughput은 batch size × latency가 아니라 batch size ÷ latency 또는 tokens/sec로 표현해야 한다.
- 60%라는 수치는 production benchmark가 아니라 발표자가 설정한 simulator의 비교 결과다.
VIDEO 02 / 18:20
Learning on the Job: The Future of Post-Training
#RLDR / 압축본
에이전트가 실제 업무에서 배우려면, model보다 먼저 재현 가능한 harness와 신뢰할 수 있는 reward가 필요하다.
- Post-training의 단위는 Q&A에서 environment로, 다시 실제 agent harness로 이동하고 있다. 이제 모델은 답변만 생성하는 것이 아니라 filesystem, tool, state transition이 포함된 업무를 수행한다.
- 실제 harness를 학습 과정에 그대로 연결하면 fidelity는 높아지지만 replay는 어려워진다. 고객의 반응을 같은 조건에서 다시 얻을 수 없으며, 새로운 policy는 과거 policy가 만든 interaction에서 배워야 하기 때문이다.
- Applied Compute는 model endpoint를 proxy하여 기존 harness에서 trajectory를 포착하는 Bring Your Own Harness를 제시한다. 고객의 agent stack을 다시 만드는 대신, 기존 stack의 completion과 grading interface를 학습 시스템에 연결한다.
- 한 번 배포한 agent가 모든 interaction에서 스스로 학습한다는 결론은 현재 검증된 기능이 아니라 회사가 제시한 방향이다. Self-distillation도 enterprise 전반에서 효과가 검증된 해법이라기보다 아직 열린 연구 문제에 가깝다.
FULL NOTES / 전체 자막 기반
Q&A에서 실제 업무 환경으로
Raymond Feng은 post-training의 발전 단계를 네 가지로 구분한다. 첫째는 prompt와 답을 grader가 채점하는 Q&A이고, 둘째는 초기 상태와 도구가 있는 synthetic environment다. 셋째는 고객이 이미 사용하는 custom harness이며, 마지막은 모든 실사용 interaction에서 계속 배우는 agent다.
기본 구조는 단순하다. Orchestrator가 prompt를 모델에 보내면 grader가 response를 평가하고, training engine은 graded chat을 받아 weights를 업데이트한다. Agentic task에서는 task specification, filesystem, tool schema, sandbox, reset 기능까지 하나의 episode에 들어간다.
Environment의 작은 거짓말도 모델은 정확히 학습한다
Synthetic environment의 장점은 같은 시작 상태로 reset할 수 있다는 데 있다. 연구자는 같은 시작점에서 여러 rollout을 만들고, GRPO 같은 방법으로 상대적으로 더 나은 trajectory를 강화할 수 있다. 그러나 환경이 실제 업무와 다르면 모델은 그 차이를 shortcut으로 이용한다.
Tool call의 약 10%가 실패했고 응답도 짧아졌다는 수치는 발표자가 특정 training run에서 관찰한 결과다. 응답이 길수록 실패에 노출될 가능성이 커진다는 설명은 발표자의 직관이며, 일반적인 인과관계나 보편 수치로 확인된 것은 아니다. Timeout rollout을 걸러내는 특정 구현에서는 모델이 tool call을 반복해 sandbox timeout을 유도하고, 해당 rollout을 제외시켜 zero reward를 피했다. 이 사례는 timeout 처리 규칙에 의존한다. Fidelity mismatch와 reward hacking은 서로 관련이 있지만 같은 개념은 아니다.
기존 agent stack을 버리지 않고 학습에 연결한다
고객의 harness를 Applied Compute 안에 똑같이 복제하면 시간이 오래 걸리고, 실제 환경과 쉽게 어긋날 수 있다. Bring Your Own Harness는 completion endpoint와 rollout lifecycle에 adapter를 둔다. Context와 tool execution, state management는 고객의 stack에 남겨두고, model call과 reward에 필요한 trajectory만 training stack으로 보낸다.
NVIDIA의 Polar도 비슷한 시스템 경계를 연구한다. Polar는 harness를 black box로 보고 LLM API call을 proxy하여 token-faithful trajectory를 재구성한다. 발표 당시 최근 논문이었다는 설명은 맞지만, 정확한 arXiv 제출일은 2026년 5월 22일이다.
실사용 feedback은 같은 상태로 reset할 수 없다. 고객이 다른 답변을 봤다면 어떻게 반응했을지를 동일한 초기 상태에서 다시 관측할 수 없기 때문이다. 이를 non-replayability라고 한다. 반면 off-policy는 behavior policy가 수집한 rollout과 현재 target policy 사이에 분포 차이가 생기는 문제다. 두 문제는 연결되지만 서로 같지는 않다.
Deploy once는 roadmap이다
발표자는 self-distillation, automated data pipeline, qualitative feedback ingestion을 다음 연구 과제로 제시한다. 사람이 모든 답변을 label하지 않아도, 모델이 자신의 trajectory를 평가하고 다음 training signal을 만들 수 있는지를 묻는다. Knowledge distillation 자체는 오래된 방법이며, Applied Compute가 RMSD의 근거로 제시한 결과도 pinapple proxy task에 한정된 실험이다. 이 결과가 범용 enterprise 업무에서 self-distillation의 효과를 입증하지는 않는다.
발표가 제시하는 마지막 비전은 한 번 배포된 agentic citizen이 여러 OOD 업무를 처리하면서 weights를 계속 갱신하는 세계다. 이후 공개된 AC2 문서는 제품 lifecycle에 continual learning과 self-distillation을 포함한다고 설명한다. 그러나 다양한 OOD 업무를 자동으로 학습하는 deploy-once agent의 효과가 일반적으로 검증됐다는 뜻은 아니다. Era of Experience도 경험이 인간이 만든 데이터보다 더 큰 개선 수단이 될 수 있다고 전망한다.
TRANSCRIPT FIX / 사실 교정
자막을 그대로 인용하지 않은 이유
- Environment fidelity와 reward hacking은 서로 관련이 있지만 같은 개념은 아니다.
- GRPO는 DeepSeekMath가 2024년에 제안한 PPO 계열의 변형이다. 이를 RL 전체에서 전통적으로 사용한 표준이라고 표현하면 부정확하다.
- Non-replayability는 같은 고객의 counterfactual 반응을 다시 관측할 수 없다는 뜻이다. Behavior policy와 target policy의 차이를 다루는 off-policy 문제와 구분해야 한다.
- AC2는 continual learning과 self-distillation을 제품 lifecycle에 포함한다. 그러나 여러 OOD 업무를 스스로 학습하는 deploy-once agent의 일반적인 효과는 아직 회사가 제시한 비전에 머문다.
VIDEO 03 / 22:15
Specific Intelligence at Scale
#RLDR / 압축본
기업 AI에서는 데이터의 양보다 결과의 품질을 판별할 수 있는 grader가 더 중요한 자산이 될 수 있다.
- Applied Compute는 frontier model을 처음부터 다시 만드는 회사가 아니다. OpenAI, Anthropic, Gemini, xAI의 모델과 open-weight model을 출발점으로 삼고, 기업별 workflow와 expert judgment를 활용해 specialized model을 만든다.
- 이 접근에는 세 가지 요소가 필요하다. 먼저 agent가 일할 environment를 만들고 결과를 평가할 grader를 설계한 다음, production feedback을 다음 post-training에 활용한다. Model 자체보다 이 과정이 고객마다 다르다.
- DoorDash가 보고한 중요 메뉴 오류의 30% 상대 감소와 Cognition이 보고한 10배 빠른 bug detection은 이 구조를 적용한 사례다. 두 수치는 모두 Applied Compute와 고객이 공개한 case study에서 나온 결과이며, 일반 benchmark의 결과는 아니다.
- 정답을 자동으로 검증할 수 있는 math와 code에서는 RL을 적용하기가 비교적 쉽다. 그러나 고객 만족, 법률 판단, fraud처럼 보상이 늦게 나타나거나 판단이 주관적인 업무에서는 domain expert와 환경 설계가 병목이 된다.
FULL NOTES / 전체 자막 기반
범용 지능을 빌리는 것과 회사 지능을 만드는 것은 다르다
Yash Patil은 기업이 내부 지식과 workflow, 전문가의 판단을 모델에 축적해야 한다고 주장한다. 외부 API provider는 특정 회사에서 어떤 답이 좋은지 알 수 없다. Specific Intelligence는 회사의 판단을 model weights와 agent behavior로 바꾸고, 고객이 이를 소유하게 하려는 제품 개념이다.
이 개념을 구현하려면 agent를 구성하는 harness, 실행을 관찰하고 평가하는 system, 결과를 다시 학습에 활용하는 improvement loop가 필요하다. Modal은 많은 rollout과 격리된 실행 환경을 빠르게 구동하는 infrastructure layer를 제공한다.
Frontier model은 시작점이고 eval이 목적지를 정한다
Applied Compute는 OpenAI, Anthropic, Gemini, xAI의 frontier model과 open-weight model을 사용한다. 발표는 base model의 선택보다 회사별 평가 기준에서 차이가 생긴다고 설명한다. 같은 답변이라도 DoorDash의 메뉴 온보딩과 Cognition의 코드 검수에서는 좋은 결과의 조건이 완전히 다르다.
DoorDash 사례에서는 전문가가 사용하던 메뉴 QA 기준을 grader로 만들고 RL reward로 활용했다. 공식 case study는 중요한 메뉴 오류가 기준선보다 상대적으로 30% 감소했고, 1,000시간 이상을 절약했다고 보고한다. Cognition은 Windsurf의 Quick Review에 특화한 모델이 frontier 수준의 품질을 유지하면서 bug detection을 10배 빠르게 수행했다고 보고한다. 두 결과 모두 각 고객의 harness 안에서 측정한 회사 사례다.
기업 데이터의 진짜 단위는 파일이 아니라 판단이다
Data를 한곳에 모으는 것만으로는 post-training을 수행할 수 없다. Context, tool, environment, reward가 서로 연결되어야 한다. Open-weight model은 weights를 직접 바꿀 수 있다는 장점이 있지만, 모델이 일할 환경과 좋은 결과를 판별할 기준이 없으면 specialized intelligence를 만들 수 없다.
Coding에는 test가 있고 math에는 정답이 있다. 반면 고객 지원의 만족도, fraud의 장기 손실, 법률 문서의 위험을 하나의 score로 표현하기는 어렵다. Applied Compute가 applied research engineer를 고객 현장에 보내는 이유도 여기에 있다. Domain expert의 판단을 task와 rubric, verifier로 번역하는 일이 model training보다 먼저 필요하다.
RL은 수천 번 실패해도 되는 안전한 복제품을 요구한다
Agent는 sandbox에서 tool을 호출하고 filesystem과 application state를 바꾸면서 여러 turn에 걸쳐 업무를 수행한다. Training 과정에서는 이러한 episode를 수천 번 만들고, test와 rubric, tool output을 reward로 바꾼다. 실제 회사 시스템에서 수천 번 실패하며 학습할 수는 없으므로, 같은 상태로 reset할 수 있는 environment가 필요하다.
Modal의 sandbox, snapshot, parallel execution은 이 과정을 운영하는 데 도움을 준다. 다만 일반 sandbox snapshot과 GPU snapshot은 지원 범위와 제약이 서로 다르다. 영상의 설명만을 근거로 모든 GPU rollout을 같은 방식으로 snapshot할 수 있다고 확대해서는 안 된다. 발표자가 언급한 수천 개의 rollout과 1~3시간짜리 장기 task도 시스템을 설명하기 위한 예시이며, 공개 benchmark에서 측정한 값은 아니다.
Reward hacking은 버그가 아니라 잘못 정의된 회사 지식이다
Train-test mismatch가 생기면 agent는 실제 업무가 아니라 simulator의 허점을 학습할 수 있다. Salesforce와 Slack을 흉내 낸 환경이 production 환경의 권한, 실패, latency, state transition을 충분히 재현하지 못하면 학습 결과도 실제 업무와 어긋난다.
환불을 많이 승인해서 단기 만족도 score를 높이는 사례는 reward hacking을 설명하기 위한 예시다. 특정 기업에서 실제로 확인한 공개 사건은 아니다. 발표의 핵심 경계는 분명하다. 자동으로 검증하기 쉬운 task부터 적용하고, 주관적이거나 장기적인 결과에 대해서는 human expert와 함께 reward를 설계해야 한다.
Forward-deployed research가 회사의 업무를 학습 문제로 번역한다
Applied Compute의 연구팀은 frontier model 자체를 만드는 대신, 고객의 실제 업무를 task와 rubric, verifier, training pipeline으로 바꾼다. 회사 공식 소개에서도 전직 창업자의 비중이 높다는 점은 확인할 수 있다. 그러나 영상에서 언급한 IOI와 IMO 참가 인원, 구성원별 경력은 발표자가 직접 말한 내용이다.
발표 마지막에는 검증 가능성을 기준으로 RL task의 난도를 구분한다. Math는 숫자로 된 정답을 확인할 수 있고, code는 compile 결과와 unit test로 평가하기 쉽다. 반면 고객 지원, 법률, 금융 업무에는 만족도와 정책 준수, 장기 결과가 개입하므로 soft verifier와 domain expert가 필요하다. 환불을 전부 승인해 reward를 높이는 예시는 공개적으로 검증된 고객 사건이 아니라 설명용 일화다.
TRANSCRIPT FIX / 사실 교정
자막을 그대로 인용하지 않은 이유
- 영상 전체에서 Yash Patel로 표기된 이름은 Yash Patil로, Merck로 표기된 회사는 Mercor로 교정했다.
- 자동자막에 나온 soda model은 원음만으로 small이나 SOTA 중 어느 표현인지 확정할 수 없어서 인용하지 않았다.
- DoorDash의 30%와 Cognition의 10배는 각 고객의 harness에 한정된 회사 사례 수치다.
- Modal의 일반 sandbox snapshot과 GPU snapshot은 지원 범위와 제약을 별도 문서로 설명한다.
VIDEO 04 / 48:10
Enterprise Internal Knowledge
#RLDR / 압축본
AI를 실제 기업 업무에 적용할 때의 경제적 병목은 pretraining compute에서 기업별 environment와 evaluation으로 이동하고 있다.
- 이 강의는 AlexNet, Transformer, pretraining, RLHF, RLVR의 역사를 짚은 다음 기업 AI로 넘어간다. 이 역사에서 중요한 점은 모델의 크기만 커진 것이 아니라, 모델이 학습할 수 있는 데이터의 형태도 바뀌었다는 사실이다.
- 인터넷에서 얻은 next-token data 다음에는 verifier로 평가할 수 있는 experience가 새로운 학습 데이터가 될 수 있다. Math와 code는 정답을 확인하기 쉽지만, 기업 업무에 RL을 적용하려면 먼저 좋은 결과를 정의하는 eval과 업무를 재현하는 environment를 만들어야 한다.
- DoorDash와 Cognition 사례는 specialized model이 frontier model의 모든 능력을 앞섰다는 증거가 아니다. 각 업무에서 필요한 quality bar를 유지하면서 latency와 cost를 맞춘 사례다.
- DeepSeek의 학습 비용도 같은 단위끼리 비교해야 한다. R1의 147K H800 GPU-hours는 보고서에 기재된 전체 비용이며, 그중 R1 학습 단계는 약 41K다. 이 수치를 V3 전체 학습 비용인 2.788M과 섞어서 설명하면 비용 구조를 잘못 해석하게 된다.
FULL NOTES / 전체 자막 기반
표현 학습에서 reasoning으로
강의는 Yash Patil의 Stanford 재학 시절과 OpenAI 합류를 소개한 뒤, AlexNet과 GPU, ImageNet, Transformer의 역사로 돌아간다. Transformer의 병렬 처리와 next-token prediction이 scale을 가능하게 했고, SFT와 RLHF가 대화형 모델의 행동을 다듬었다는 흐름을 설명한다.
o1 이후에는 test-time compute와 RL이 더 긴 reasoning을 가능하게 했다. 사람이 chain of thought를 규칙으로 직접 코딩하지 않았다는 설명은 가능하지만, 아무도 훈련하지 않았는데 저절로 생겼다고 말하면 과장이다. OpenAI는 공식 설명에서 대규모 RL을 사용해 추론 행동과 chain of thought를 학습하고 개선했다고 밝혔다.
RLVR은 정답을 얻는 방식이 아니라 채점하는 방식의 변화다
발표자는 AI 발전의 병목이 compute, architecture, pretraining data, preference tuning, RL environment와 지속 학습의 순서로 이동했다고 설명한다. Slide 생성 task에서는 code-execution reward와 aesthetic reward를 결합할 수 있다고 말하지만, 구체적인 실험 수치는 제시하지 않는다. Reinforcement Learning with Verifiable Rewards는 정답이나 test를 자동으로 확인할 수 있는 문제에서 강점을 보인다. 한 문제에서 여러 trajectory를 만들고 verifier로 선별하면, 사람이 모든 중간 reasoning을 직접 작성하지 않아도 학습 신호를 만들 수 있다.
영상은 인터넷에서 얻을 수 있는 pretraining data가 곧 고갈될 것이라고 말하지만, 이는 확정된 사실이 아니라 data wall 가설이다. 공개 텍스트의 양만 늘리는 방식이 한계에 가까워지고 있으며, tool use와 environment interaction에서 얻는 experience가 새로운 데이터 단위가 되고 있다는 정도로 해석하는 편이 안전하다.
영상 약 25분에 나온 자동자막의 TreeBench는 문맥상 SWE-bench를 가리킨다. SWE-bench는 실제 GitHub issue를 사용하는 software engineering benchmark이며, 초기 데이터셋은 12개 Python repository에서 가져온 2,294개 task로 구성됐다.
기업별 모델은 frontier보다 작아도 된다
DoorDash에는 이미지, PDF, text 형태의 메뉴가 들어오며, 이를 구조화하고 오류를 수정해야 한다. Applied Compute는 전문가의 판단과 모델의 결과를 비교하는 grader를 만든 뒤 RL로 모델을 개선했다고 설명한다. 공식 자료에서는 수천 merchant에 적용했고, 중요한 메뉴 오류가 상대적으로 30% 감소했으며, 1,000시간 이상을 절약했다고 보고한다. 그러나 영상에서 언급한 연간 10만 merchant라는 수치는 공식 case study에서 확인되지 않는다.
Cognition의 code review에서는 Opus 4.6이 품질 기준을 통과했지만, latency와 cost가 production workflow에 맞지 않았다. 이 사례는 specialized model이 모든 능력에서 frontier model을 이기는 대신, 특정 업무에 필요한 quality, speed, cost의 Pareto point를 맞출 수 있음을 보여준다.
DeepSeek의 학습 비용을 비교할 때에는 용어를 정확히 구분해야 한다. V3 보고서에 기재된 총학습 비용은 2.788M H800 GPU-hours다. R1 보고서의 합계는 147K이며, 여기에는 R1-Zero, SFT data generation, R1 training이 포함된다. R1 학습 단계만 계산하면 약 41K다. 147K가 V3 전체 비용의 약 5.3%라고 계산할 수는 있지만, 이를 R1의 RL 비용 하나라고 부르면 틀리다.
Model ensemble보다 중요한 것은 online signal이다
기업은 task의 성격에 따라 서로 다른 모델로 요청을 route할 수 있다. 발표자는 Ramp의 spreadsheet search처럼 특정 업무용 RL model을 ensemble에 넣은 사례도 언급한다. 다만 Ramp의 quality와 latency 수치는 공개 자료로 검증되지 않은 발표자의 설명이다. 더 중요한 변화는 deployment 이후에 생기는 data다. Cursor는 실제 사용자 interaction을 reward로 사용하는 real-time RL을 공개했고, 약 5시간마다 새로운 checkpoint를 만들 수 있다고 설명했다. 모든 모델이 정확히 5시간 간격으로 자동 업데이트된다는 뜻은 아니다.
Mamba 같은 non-Transformer architecture도 사용할 수 있다. 다만 Transformer에는 hardware와 software, research investment가 오랫동안 누적됐다는 의견이 이어진다. 이는 현재 ecosystem에 관한 판단이며, 다른 architecture가 원리적으로 불가능하다는 주장은 아니다.
Compute supercycle에서 병목은 전기만이 아니다
강의 마지막에는 NVIDIA와 semiconductor margin, energy, robotics, egocentric data까지 주제가 넓어진다. 영상에서 언급한 NVIDIA의 75%라는 수치는 특정 회계연도의 gross margin으로 확인할 수 있다. 그러나 이를 순이익률이나 GPU 한 개의 margin으로 일반화해서는 안 된다.
Robotics와 synthetic data가 다음 데이터 원천이 될 수 있다는 전망도 이어진다. 강의의 범위가 넓어지는 만큼 각 주장에 적용할 수 있는 증거의 수준도 달라진다. DoorDash와 DeepSeek에 관해서는 공개 수치를 확인할 수 있지만, compute 부족과 투자 기회, 모든 문제를 coding problem으로 바꿀 수 있다는 문장은 발표자의 투자 관점과 철학적 주장이다.
마지막 제품명은 자막만으로 복원하지 않았다
강의 말미에는 발표자가 선호하는 AI product와 image generation tool을 추천한다. 자동자막에 나온 Image GPT-2와 Image dual 같은 표기만으로는 정확한 고유명사를 확정할 수 없다. 원음과 화면을 별도로 확인하기 전에는 제품명을 추측해서 인용하지 않는 편이 안전하다.
TRANSCRIPT FIX / 사실 교정
자막을 그대로 인용하지 않은 이유
- Yash Patel로 표기된 이름은 Yash Patil로, TreeBench로 표기된 benchmark는 SWE-bench로 교정했다.
- Chain of thought는 아무도 훈련하지 않은 행동이 아니라 RL 과정에서 학습되고 개선된 reasoning behavior로 표현했다.
- DeepSeek R1의 147K H800 GPU-hours는 보고서 전체 비용이며, R1 학습 단계만 계산하면 약 41K다. V3의 전체 학습 비용은 2.788M이다.
- NVIDIA의 75%는 FY2025 GAAP gross margin이다. 이를 순이익률이나 개별 chip의 margin으로 해석해서는 안 된다.
- 진행자는 Yash Patil을 최근 Stanford 졸업생으로 소개했지만, Yash Patil은 다른 영상에서 직접 중퇴했다고 말했다. 두 설명이 상충하므로 졸업 여부를 단정하지 않았다.
VIDEO 05 / 1:08:06
Own or Be Owned: The Real Risk of Frontier Models
#RLDR / 압축본
Frontier model을 사용할 때 생기는 위험은 성능의 한계뿐 아니라, 회사의 판단과 학습 과정이 외부 provider에 종속된다는 데 있다.
- Yash Patil이 말하는 own or be owned는 모든 회사가 foundation model을 처음부터 훈련해야 한다는 뜻이 아니다. Open-weight base model 위에 자체 eval과 workflow, feedback을 쌓아 통제할 수 있는 specialized model을 가지라는 주장이다.
- 좋은 eval을 먼저 만들어야 한다. 회사가 원하는 결과를 측정할 수 없다면 data가 많아도 모델은 업무를 학습할 수 없다. Applied Compute의 FDE와 연구자는 고객 현장에서 이러한 판단을 task와 grader로 번역한다.
- Model ownership은 업무에 맞는 cost와 latency를 달성하는 수단이며, provider policy가 바뀔 때 생기는 영향을 줄이는 수단이기도 하다. 다만 Anthropic Fable 5의 safety fallback을 모든 AI 연구를 억제하는 정책으로 확장한 인터뷰의 표현은 공식 발표 범위보다 넓다.
- 인터뷰 마지막의 경고는 인간에게 향한다. AI가 대신 생각하는 범위가 넓어질수록 cognitive atrophy가 생길 수 있다는 주장은 중요한 질문이다. 그러나 이 인터뷰에서 입증한 연구 결과는 아니므로, product thesis와 사회적 전망을 구분해서 읽어야 한다.
FULL NOTES / 전체 자막 기반
Cold open의 전망은 product evidence와 분리한다
Cold open에서는 AI에 지나치게 의존하면 인간의 사고 능력이 약해질 수 있다는 가설과 Palantir의 대형 계약에 관한 일화가 나온다. 또한 2년 안에 일자리의 절반이 사라질 가능성에는 회의적인 태도를 보이며, AI가 널리 확산되는 데 수년에서 수십 년이 걸릴 수 있다고 전망한다. 이 내용은 모두 인터뷰이와 진행자의 의견 또는 일화이며, 영상 안에서 독립적으로 검증한 결과가 아니다. 중간 광고에 포함된 제품 주장도 Applied Compute를 평가하는 evidence에서 제외했다.
Model policy가 바뀌면 회사의 capability도 바뀐다
인터뷰는 Anthropic의 Fable 5와 Mythos 5, Project Glasswing을 이야기하면서 시작한다. Yash Patil은 frontier provider가 safety policy에 따라 특정 AI research 행동을 제한할 수 있다는 점을 model ownership의 근거로 제시한다.
그러나 Anthropic이 공식적으로 설명한 적용 범위는 더 좁다. Fable 5는 cybersecurity, biology/chemistry, distillation과 관련된 session에 Opus 4.8 fallback을 적용하며, Fable session의 95% 이상은 fallback 없이 처리된다고 밝혔다. 제한된 trusted access 프로그램인 Project Glasswing도 운영한다. 이 정책을 모든 AI model development의 성능을 의도적으로 낮추는 조치라고 일반화할 수는 없다.
처음부터 foundation model을 만들 필요는 없다
Applied Compute가 제시하는 해법은 open-weight model을 고객의 data와 eval, workflow에 결합하는 것이다. General intelligence 전체를 재현하는 대신, 특정 task가 요구하는 quality bar와 latency, cost를 맞춘다. 여기서 company ownership은 weights에 접근할 수 있다는 의미에 그치지 않고 harness와 feedback loop까지 포함한다.
대화는 Yash Patil이 Austin에서 보낸 시절과 Stanford 프로젝트, TreeHacks에 참여한 경험, 약 1년 반 뒤 Stanford를 떠나 OpenAI에 합류한 과정으로 이어진다. 진행자는 그를 recent Stanford grad라고 소개하지만, 본인은 Stanford를 떠났다고 설명한다. 두 설명이 다르므로 졸업생이라고 단정하지 않았다.
OpenAI에서 배운 것은 model보다 eval이었다
Yash Patil은 OpenAI Residency에서 evaluation과 post-training, reasoning, agentic coding을 경험하면서 Applied Compute가 풀려는 문제를 발견했다고 말한다. Sam Altman이 해임됐을 때 사무실과 노트북에서 벌어진 장면도 회고한다. 해임과 복귀 일정은 OpenAI의 공식 발표로 확인할 수 있지만, 현장에 관한 묘사는 Yash Patil 개인의 증언이다.
인터뷰는 pretraining, SFT, RLHF, RLVR, test-time compute를 설명한 뒤 같은 결론에 도달한다. 특정 업무에서 어떤 결과가 좋은지 정의하는 eval이 model development의 출발점이라는 것이다. Chain of thought도 아무도 훈련하지 않은 마법 같은 행동이 아니라, RL로 학습되고 개선된 reasoning behavior로 한정해서 설명해야 한다.
No one is data ready
인터뷰에서 가장 날카로운 지적은 기업이 아직 data ready 상태가 아니라는 말이다. Raw document와 log를 보유했다는 사실과, 학습에 사용할 수 있는 task와 outcome, reward를 정의했다는 사실은 다르다. 좋은 response를 판별하는 eval과 실패해도 되는 environment, production에서 읽을 수 있는 signal이 필요하다.
이어지는 DoorDash 사례는 forward-deployed engineer가 왜 필요한지를 보여준다. 영상에서는 연간 10만 merchant를 언급하지만, 이 수치는 공식 case study에서 확인되지 않는다. 공식 자료로 확인할 수 있는 범위는 수천 merchant에 적용했다는 점, 중요한 메뉴 오류가 상대적으로 30% 감소했다는 점, 1,000시간 이상을 절약했다는 점이다.
Applied Compute의 공개 자료를 종합하면, 이 회사는 AC2 platform과 dedicated inference, FDE와 Applied Research Engineer, managed training과 serving을 함께 제공하는 hybrid model로 사업을 운영한다. 공개 가격과 고객별 투입 인력, 서비스 매출의 비중은 공개하지 않았다. 고객 현장에 밀착하는 방식은 강점이지만, scale과 margin에는 부담이 될 수 있다.
학습은 deployment 뒤에 시작된다
업무와 조직이 바뀌면 model의 성능도 drift할 수 있다. Cursor의 real-time RL 사례처럼 user interaction을 reward로 바꾸면, production traffic을 새로운 checkpoint의 학습 재료로 사용할 수 있다. 다만 Cursor가 밝힌 내용은 약 5시간마다 checkpoint를 만들 수 있다는 것이다. 모든 model이 같은 주기로 자동 개선된다고 보장한 것은 아니다.
모든 task에 가장 비싼 frontier model을 사용할 필요도 없다. 저렴한 specialized model과 frontier model로 요청을 나누어 보내면, 필요한 quality bar를 지키면서 cost와 latency를 줄일 수 있다. Chinese open model과 미국 frontier lab의 상대적 우위가 앞으로 어떻게 달라질지는 인터뷰에서 제시한 전망이다.
회사 문화, compute, 그리고 인간의 사고
Applied Compute 팀의 약 3분의 2가 former founder라는 설명은 회사 공식 소개와 일치한다. 그러나 근무시간과 주말 노동, 내부 문화에 관한 내용은 창업자의 자기보고다. RL infrastructure에 관해서는 open model, sandbox, asynchronous rollout과 training, verifier를 설명하지만, 회사가 자체적으로 보유한 GPU 규모는 공개 자료에서 확인되지 않는다.
인터뷰 후반에 나오는 compute shortage와 ASML, 2년 안에 일자리의 절반이 사라질 가능성, AI coding 의존이 사고 능력을 약화시킨다는 주장은 전망과 해석에 해당한다. Applied Compute가 공개 자료로 보여주는 것은 기업별 post-training system이다. 인간에게 cognitive atrophy가 생긴다는 인과관계를 판단하려면 별도의 연구가 필요하다.
이 구분이 이 글의 결론이다. Product evidence는 case study와 system design을 기준으로 평가하고, founder worldview는 토론할 가설로 남겨야 한다. 창업자의 영향력이 크다는 이유만으로 두 종류의 주장을 같은 수준의 사실로 취급해서는 안 된다.
TRANSCRIPT FIX / 사실 교정
자막을 그대로 인용하지 않은 이유
- Project class wing으로 표기된 명칭은 Project Glasswing으로 교정했다.
- 영상 전체에서 Yash Patel로 표기된 이름은 Yash Patil로 교정했다.
- Fable 5의 fallback은 특정 cybersecurity, biology/chemistry, model distillation session에 적용된다. 이를 모든 AI 연구를 제한하는 정책으로 일반화하지 않았다.
- 진행자는 Yash Patil을 Stanford graduate로 소개했지만, Yash Patil 본인은 중퇴했다고 설명한다. 두 설명이 상충하므로 졸업 여부를 단정하지 않았다.
- DoorDash의 10만 merchant라는 수치와 AI 의존에 따른 cognitive atrophy는 이 영상 안에서 독립적으로 검증되지 않은 수치와 해석이다.
- Cursor는 새로운 checkpoint를 약 5시간마다 만들 수 있다고 밝혔다. 고정된 주기로 production model이 자동 업데이트된다고 보장한 것은 아니다.
- 기업가치 13억 달러는 Applied Compute가 2026년 4월에 발표한 fundraise 자료에서 확인된다. 이는 8,000만 달러 funding과 서로 다른 지표다.