무슨 일
Anthropic Institute가 프론티어 랩 안에서 AI가 다음 AI를 얼마나 만드는지 밖에서도 추적할 수 있게 세 지표—AI가 주도하는 R&D 비중, 에이전트 감독, 컴퓨트 배분—를 공개했습니다. 페이싱 논의에 맞춰 내부 속도 수치를 스스로 내놓은 형태입니다.
세 지표
첫째는 Epoch식 Automation Level을 쓴 R&D Automation Index입니다. AL3는 AI가 협업하고, AL4는 고수준 프롬프트로 대부분을 끝내며 사람이 감독하는 “리드”, AL5는 완전 자율입니다. 2026년 8월 스냅샷에서 Claude는 측정 구간에서 AL5가 없고, AI R&D의 약 26%를 리드하며, 협업(AL3) 이상 비중은 90%를 넘는다고 했습니다.
둘째는 에이전트 감독입니다. 가장 많이 쓰는 내부 플랫폼에 동시 약 3만 에이전트가 연구·엔지니어링을 돌리고, 그 플랫폼 기준 온라인·오프라인 모니터 커버리지는 각각 100%로 보고됐습니다. 온라인 차단률은 약 0.002%(약 4만 7천 건 중 1건) 수준입니다.
셋째는 컴퓨트입니다. 조사 주간에 AI R&D 컴퓨트의 약 6%, AI-driven AI R&D의 약 12%가 안전으로 잡혔다고(보수적 정의) 공개했습니다. 능력이든 안전이든 비슷하게 쓰인 토큰은 안전에서 빼는 식입니다.
맥락
능력 평가만으로는 “생산 공정”이 안 보입니다. 자동화 비중·오버사이트·안전 vs 역량 컴퓨트는 정부가 페이싱을 말할 때 필요한 입력에 가깝습니다. Anthropic은 제3자 평가자를 내부에 임베드해 이런 지표를 검증하겠다고도 적었습니다.
프론티어 워처에게
AI가 AI를 만드는 정도를 랩이 스스로 수치화해 공개한 첫 사례에 가깝습니다. 숫자 자체보다, 다른 랩이 같은 방법론으로 공개·교차검증할 수 있느냐가 다음 질문입니다.