무슨 일

Claire Vo가 How I AI에서 Opus 5.5 / GPT-6 Sol–Luna 동시 출시 직후 라이브 블라인드 벤치를 돌렸습니다. 글쓰기, 프론트엔드 프로토타입, 장시간 에이전트, SVG, 코딩, 영상 편집을 채점했고, 어떤 모델이 어떤 출력을 냈는지 모른 채 순위를 매긴 뒤 공개했습니다.

순위 인상

본인 취향에서는 Astra가 이겼고, 에이전트·B2B 프론트엔드에서는 Opus 5.5가 전반적으로 가장 강할 수 있으며, Sol은 명확한 글쓰기와 가격에서 우위로 정리했습니다. LLM 심판과 인간 순위가 어긋나는 지점도 짚었습니다.

Barbie Bench

현실 점검용으로 Barbie Bench로 돌아와 AGI 과장을 견제합니다. 벤더 슬라이드가 아니라 제품 실무 작업으로 이중 드롭을 읽습니다.

왜 지금

같은 날 나온 모델 전쟁을 ‘표’가 아니라 빌더의 블라인드 맛보기로 환원하는 실무자 평가입니다. 기본 스택을 고르는 사람에게 바로 쓸 수 있는 신호입니다.