Codecast
로컬 daemon, 멀티 에이전트 동기화, 검색과 session fork.
시장 지도 / 2026-09-02 재검증
세션 보관, 평가 플랫폼, RL 환경, 전문가 데이터 공급은 이미 실제 제품과 프로그램으로 존재합니다. 하지만 2026-09-02까지 확인한 공식 자료에서는 로컬 코딩 에이전트 기록 수집부터 권리 관리, 환경 재구성, 여러 모델의 재실행, artifact 검증, 기여자 보상, buyer 전달까지 한 번에 설명하는 서비스를 찾지 못했습니다. 조사 범위에서 못 찾았다는 뜻이지, 시장에 없다고 단정할 수는 없습니다.
FIELD NOTES / 심층 연구
RLDR 영상의 논지와 예시, 작동 원리와 한계를 실제 장면과 원문 출처를 따라 읽습니다.
2026.09.17 / TASK NOTEBOOKHarbor, Prime Verifiers, Inspect에서 같은 원장 정리 작업을 만든다. 완성된 파일 구조, 만드는 순서, LLM이 들어가는 자리를 함께 연다.
2026.09.17 / CONTINUAL LEARNINGTrajectory와 기업별 continual learning. 직원의 수정이 다음 모델의 능력으로 남으려면.
2026.09.17 / RL ENVIRONMENTSRL 환경을 만드는 작은 팀의 값어치. 납품한 태스크와 다음 제작에 남는 연구를 함께 본다.
01 / APPLIED COMPUTE5편의 발표와 1차 자료로 Specific Intelligence의 사업·기술·미래를 검증했다.
02 / TERMINAL-BENCH328개 제안, 624개 task PR, rs-archive-clone의 anti-cheat 진화를 추적했다.
제한된 가설
Datafooding의 whitespace 가설은 로그를 더 잘 보여주는 데 있지 않습니다. 개인 세션을 건드리지 않은 채 허용된 task 하나를 고르고, 제한된 환경에서 여러 model/harness 조건을 다시 실행한 다음, 미래 buyer가 확인할 artifact-bound 검증 수령증까지 남기는 공정을 말합니다.
01 / 보관과 탐색
로컬 daemon, 멀티 에이전트 동기화, 검색과 session fork.
transcript, tool call, file change를 Git checkpoint에 연결.
2026-09-02에 검토한 공개 README에 이름이 열거된 coding-agent provider를 로컬에서 색인하고 검색.
agent trace를 살펴보고 비교하는 로컬 index와 web UI.
Copilot session은 private-by-default sync와 Chronicle 탐색을 지원합니다. VS Code는 별도로 로컬 Claude Code·Codex session을 발견하지만, 공개 문서는 이 외부 session도 GitHub에 sync된다고 말하지 않습니다.
02 / 재실행과 검증
agent trace를 가져오거나 기록하고, 저장된 tool response로 실제 agent code를 다시 실행해 model·prompt·code 변경을 비교.
agent를 평가하고 environment를 만들며 RL optimization용 rollout을 생성하는 오픈소스 framework.
agent evaluation, environment, verifier를 정의하고 parallel task run을 실행하는 SDK·platform.
Dataset, solver, scorer, sandbox, parallel execution과 Claude Code·Codex CLI 같은 외부 agent integration을 제공하는 공개 evaluation framework.
Trace, dataset, experiment, side-by-side 비교, human review와 traced run에서 local agent를 복제하는 경로를 제공.
Production trace와 사람이 검토한 example을 versioned dataset, eval, regression experiment로 전환.
Trace, dataset, experiment, human·model·programmatic score와 API·export를 제공하는 오픈소스 platform.
공개 company 자료는 실제 product usage를 instrument하고 governed training data와 지속적인 model-improvement loop를 운영하는 방향을 설명합니다. Company 제품군의 선례이지 Datafooding이 같은 기능을 이미 제공한다는 증거는 아닙니다.
공개 company 자료는 고객 데이터와 evaluation harness를 중심으로 custom model을 training, deployment, iteration하는 서비스를 설명합니다. Private-model 서비스의 시장 선례이지 현재 Datafooding 기능은 아닙니다.
Open-source tracing, human·code 기반 evaluation, versioned dataset, prompt·model 비교, span replay, 동일 input 기반 experiment를 제공.
Agent session tracing, curated evaluation dataset, prompt·model 비교, versioned artifact, human annotation을 제공.
RL과 evaluation을 위한 community environment hub와 Prime 관리 인프라의 hosted run.
WebArena, WorkArena, AssistantBench 등을 묶는 확장 가능한 web-agent environment·benchmark framework.
Coding session 바깥의 두 environment 선례입니다. OSWorld는 실제 desktop app에서 agent를 실행하고, AppWorld는 제어 가능한 API app과 실행 점수형 interactive coding task를 제공합니다.
2026-08-26 공개된 v4.0.0이 이번 검토에서 확인한 최신 GitHub release입니다. 열린 v4.1 issue가 지원 agent 제출에 Harbor Hub verified run을 제안하지만 아직 배포된 정책은 아닙니다.
03 / 공급 프로그램
공개 페이지는 beta dataset listing, Stripe checkout, sample 구매, Harbor/HUD managed delivery를 문서화합니다. 검토한 자료에서는 완료된 거래나 buyer acceptance의 독립 증거를 찾지 못했습니다.
Enterprise workflow를 위한 직접적인 rights-governed data supply 경쟁사입니다. 공개 자료는 구조화·비식별 record, package별 승인, audit trail, on-prem·VPC option을 설명합니다. Coding session 전용은 아닙니다.
공개 product 자료는 RL environment와 agent, rubric과 verifier, RLHF, SFT, human evaluation을 설명합니다.
공개 product 자료는 전문가 작성 dataset, RL environment, trajectory capture, sample·engagement 요청으로 제공되는 custom 또는 off-the-shelf dataset을 설명합니다.
공개 company 자료는 실제 task에서 수집한 human-verified browser trajectory와 training용 데이터 전달을 설명합니다.
공개 benchmark 기여 프로그램입니다. 모든 task는 instruction, baseline, environment, verifier로 구성됩니다. 초기 50개 task에는 accepted task당 $2,000을 제시하며 benchmark data가 training corpora에 들어가면 안 된다고 명시합니다. 이는 RSI Bench의 프로그램이며 Datafooding의 지급이나 buyer 제안이 아닙니다.
정확한 결합 테스트
Codecast, Entire, CASS, AgentLens, VS Code/GitHub는 수집, sync, 검색, 탐색의 상당 부분을 이미 다룹니다. Archive UX만으로는 moat를 설명하기 어렵습니다.
Kitaru는 trace 기반 replay와 model·prompt·code 변경 테스트를 지원합니다. Harbor, HUD, Inspect, Phoenix, Weave, BrowserGym, OSWorld, AppWorld, Prime도 evaluation, environment, rollout, 비교 primitive를 폭넓게 제공합니다.
DataVendor, Scale, Surge, Turing, Slesh는 인접 marketplace와 공급 workflow를 공개했습니다. 다만 공개 listing만으로 실제 거래나 buyer acceptance까지 확인할 수는 없습니다.
사용자가 고른 세션을 독립적으로 재현할 수 있고 권리도 확인된 comparison unit으로 컴파일합니다. 저장한 byte보다 yield와 accepted-unit cost가 중요합니다.
실제 / 합성 / 경계 / 아직 아님
통제된 owner Mac에서 client-encrypted GCS 업로드, remote-only bit-perfect 복원, agent-home archive, source 보존을 확인했습니다. 테스트한 artifact에 한정된 결과이며, 보편적인 안전성이나 production 신뢰성을 증명하지는 않습니다.
Prospective Git snapshot을 fixed Datafooding harness, model target, 격리 workspace, comparison-pack metadata와 묶는 데 성공했습니다.
현재 runner test는 fake provider와 sandbox를 씁니다. Hosted comparison review는 아직 production buyer receipt로 검증하지 못했습니다.
Comparison 제출과 prototype credit은 내부 심사 artifact입니다. 사용자 지급, buyer 전달, training 권리, resale 권리는 여기서 생기지 않습니다.
과거 Claude/Codex/Hermes product-stack replay, 독립 verifier attestation·fleet, buyer delivery, 외부 training, 현금성 payout은 아직 없습니다. 로컬 HMAC registry와 mutation control도 제한된 pilot 증거입니다.
첫 결정적 증거는 작아야 합니다. 허용된 과거 task 하나, 모델 두 개 이상, 각 세 번 이상 반복, 독립 operator 복원, 잠재 buyer가 제시한 acceptance criterion 하나입니다.