시장 지도 / 2026-09-02 재검증

조각은 이미 있다.권리 검증된 변환 체인은 아직 입증되지 않았다.

세션 보관, 평가 플랫폼, RL 환경, 전문가 데이터 공급은 이미 실제 제품과 프로그램으로 존재합니다. 하지만 2026-09-02까지 확인한 공식 자료에서는 로컬 코딩 에이전트 기록 수집부터 권리 관리, 환경 재구성, 여러 모델의 재실행, artifact 검증, 기여자 보상, buyer 전달까지 한 번에 설명하는 서비스를 찾지 못했습니다. 조사 범위에서 못 찾았다는 뜻이지, 시장에 없다고 단정할 수는 없습니다.

FIELD NOTES / 심층 연구

RLDR / 학습 소스

AI가 배우고 일하는 방식을 영상과 글로 살펴봅니다

RLDR 영상의 논지와 예시, 작동 원리와 한계를 실제 장면과 원문 출처를 따라 읽습니다.

2026.09.17 / TASK NOTEBOOK

에이전트 task 하나를 직접 만들어보면

Harbor, Prime Verifiers, Inspect에서 같은 원장 정리 작업을 만든다. 완성된 파일 구조, 만드는 순서, LLM이 들어가는 자리를 함께 연다.

2026.09.17 / CONTINUAL LEARNING

AI를 고친 시간은 누구의 자산이 되는가

Trajectory와 기업별 continual learning. 직원의 수정이 다음 모델의 능력으로 남으려면.

2026.09.17 / RL ENVIRONMENTS

Mechanize, 다음 태스크에 남는 연구

RL 환경을 만드는 작은 팀의 값어치. 납품한 태스크와 다음 제작에 남는 연구를 함께 본다.

01 / APPLIED COMPUTE

기업은 모델이 아니라 학습 루프를 소유한다

5편의 발표와 1차 자료로 Specific Intelligence의 사업·기술·미래를 검증했다.

02 / TERMINAL-BENCH

어려운 일을 어떻게 측정 가능한 태스크로 만드는가

328개 제안, 624개 task PR, rs-archive-clone의 anti-cheat 진화를 추적했다.

제한된 가설

Datafooding의 whitespace 가설은 로그를 더 잘 보여주는 데 있지 않습니다. 개인 세션을 건드리지 않은 채 허용된 task 하나를 고르고, 제한된 환경에서 여러 model/harness 조건을 다시 실행한 다음, 미래 buyer가 확인할 artifact-bound 검증 수령증까지 남기는 공정을 말합니다.

01 / 보관과 탐색

CASS

2026-09-02에 검토한 공개 README에 이름이 열거된 coding-agent provider를 로컬에서 색인하고 검색.

VS Code / GitHub

Copilot session은 private-by-default sync와 Chronicle 탐색을 지원합니다. VS Code는 별도로 로컬 Claude Code·Codex session을 발견하지만, 공개 문서는 이 외부 session도 GitHub에 sync된다고 말하지 않습니다.

02 / 재실행과 검증

Kitaru

agent trace를 가져오거나 기록하고, 저장된 tool response로 실제 agent code를 다시 실행해 model·prompt·code 변경을 비교.

Harbor

agent를 평가하고 environment를 만들며 RL optimization용 rollout을 생성하는 오픈소스 framework.

HUD

agent evaluation, environment, verifier를 정의하고 parallel task run을 실행하는 SDK·platform.

Inspect AI

Dataset, solver, scorer, sandbox, parallel execution과 Claude Code·Codex CLI 같은 외부 agent integration을 제공하는 공개 evaluation framework.

Trajectory

공개 company 자료는 실제 product usage를 instrument하고 governed training data와 지속적인 model-improvement loop를 운영하는 방향을 설명합니다. Company 제품군의 선례이지 Datafooding이 같은 기능을 이미 제공한다는 증거는 아닙니다.

Applied Compute

공개 company 자료는 고객 데이터와 evaluation harness를 중심으로 custom model을 training, deployment, iteration하는 서비스를 설명합니다. Private-model 서비스의 시장 선례이지 현재 Datafooding 기능은 아닙니다.

Arize Phoenix

Open-source tracing, human·code 기반 evaluation, versioned dataset, prompt·model 비교, span replay, 동일 input 기반 experiment를 제공.

BrowserGym

WebArena, WorkArena, AssistantBench 등을 묶는 확장 가능한 web-agent environment·benchmark framework.

OSWorld / AppWorld

Coding session 바깥의 두 environment 선례입니다. OSWorld는 실제 desktop app에서 agent를 실행하고, AppWorld는 제어 가능한 API app과 실행 점수형 interactive coding task를 제공합니다.

Terminal-Bench v4.0.0

2026-08-26 공개된 v4.0.0이 이번 검토에서 확인한 최신 GitHub release입니다. 열린 v4.1 issue가 지원 agent 제출에 Harbor Hub verified run을 제안하지만 아직 배포된 정책은 아닙니다.

03 / 공급 프로그램

DataVendor

공개 페이지는 beta dataset listing, Stripe checkout, sample 구매, Harbor/HUD managed delivery를 문서화합니다. 검토한 자료에서는 완료된 거래나 buyer acceptance의 독립 증거를 찾지 못했습니다.

Scale Data Partnerships

Enterprise workflow를 위한 직접적인 rights-governed data supply 경쟁사입니다. 공개 자료는 구조화·비식별 record, package별 승인, audit trail, on-prem·VPC option을 설명합니다. Coding session 전용은 아닙니다.

Surge AI

공개 product 자료는 RL environment와 agent, rubric과 verifier, RLHF, SFT, human evaluation을 설명합니다.

Turing Frontier AI

공개 product 자료는 전문가 작성 dataset, RL environment, trajectory capture, sample·engagement 요청으로 제공되는 custom 또는 off-the-shelf dataset을 설명합니다.

Slesh

공개 company 자료는 실제 task에서 수집한 human-verified browser trajectory와 training용 데이터 전달을 설명합니다.

RSI Bench

공개 benchmark 기여 프로그램입니다. 모든 task는 instruction, baseline, environment, verifier로 구성됩니다. 초기 50개 task에는 accepted task당 $2,000을 제시하며 benchmark data가 training corpora에 들어가면 안 된다고 명시합니다. 이는 RSI Bench의 프로그램이며 Datafooding의 지급이나 buyer 제안이 아닙니다.

정확한 결합 테스트

정확한 전체 체인은 날짜와 범위가 붙은 가설입니다.

01

Archive 경쟁

Codecast, Entire, CASS, AgentLens, VS Code/GitHub는 수집, sync, 검색, 탐색의 상당 부분을 이미 다룹니다. Archive UX만으로는 moat를 설명하기 어렵습니다.

02

Replay 경쟁

Kitaru는 trace 기반 replay와 model·prompt·code 변경 테스트를 지원합니다. Harbor, HUD, Inspect, Phoenix, Weave, BrowserGym, OSWorld, AppWorld, Prime도 evaluation, environment, rollout, 비교 primitive를 폭넓게 제공합니다.

03

데이터 공급

DataVendor, Scale, Surge, Turing, Slesh는 인접 marketplace와 공급 workflow를 공개했습니다. 다만 공개 listing만으로 실제 거래나 buyer acceptance까지 확인할 수는 없습니다.

04

Datafooding whitespace 가설

사용자가 고른 세션을 독립적으로 재현할 수 있고 권리도 확인된 comparison unit으로 컴파일합니다. 저장한 byte보다 yield와 accepted-unit cost가 중요합니다.

실제 / 합성 / 경계 / 아직 아님

아직 하지 못한 일도 함께 적습니다.

OBSERVED

통제된 owner Mac에서 client-encrypted GCS 업로드, remote-only bit-perfect 복원, agent-home archive, source 보존을 확인했습니다. 테스트한 artifact에 한정된 결과이며, 보편적인 안전성이나 production 신뢰성을 증명하지는 않습니다.

OBSERVED PROTOTYPE

Prospective Git snapshot을 fixed Datafooding harness, model target, 격리 workspace, comparison-pack metadata와 묶는 데 성공했습니다.

SYNTHETIC

현재 runner test는 fake provider와 sandbox를 씁니다. Hosted comparison review는 아직 production buyer receipt로 검증하지 못했습니다.

BOUNDARY

Comparison 제출과 prototype credit은 내부 심사 artifact입니다. 사용자 지급, buyer 전달, training 권리, resale 권리는 여기서 생기지 않습니다.

NOT YET

과거 Claude/Codex/Hermes product-stack replay, 독립 verifier attestation·fleet, buyer delivery, 외부 training, 현금성 payout은 아직 없습니다. 로컬 HMAC registry와 mutation control도 제한된 pilot 증거입니다.

첫 결정적 증거는 작아야 합니다. 허용된 과거 task 하나, 모델 두 개 이상, 각 세 번 이상 반복, 독립 operator 복원, 잠재 buyer가 제시한 acceptance criterion 하나입니다.