AI 오피니언 브리프
2026.09.23 · 서울 06:00
TODAY TLDR
Anthropic Opus 5.5와 OpenAI GPT-6 Sol·Luna가 같은 날 가격·효율 전쟁을 열었고, OpenAI는 제3자 안전 평가 원칙을 냈으며, Lenny’s 이밸 가이드·Latent Space MiMo 브리핑·Willison의 Jev 해설이 뒤를 이었다.
Anthropic
Fable 5.1급 성능 · Opus 5 대비 비용↓약 40% ($4/$20, 캐시 $0.20)
페이싱 이후 첫 Opus · METR/Frontier Design 사전 평가 · 행동 감사 최고점 주장
사이버/바이오 Fable급 세이프가드 · Verification 프로그램
왜 페이싱 선언 뒤 효율·정렬·세이프가드를 묶은 Opus 기준점
OpenAI
Astra급 방법을 Sol·Luna로 · API 가격 5.6 대비 50%↓
프롬프트 캐시 개선(캐시 입력 최대 90% 할인) · 정렬 개선
Work/Codex·API gpt-6-sol / gpt-6-luna · Opus 5.5와 같은 날
왜 같은 날 가격 전쟁—비용–지능 곡선의 중·하위 티어 공세
OpenAI Safety
민간·비영리 독립 평가에 학습·평가·배포 접근을 깊게 열겠다는 원칙
안전 주장 vs 안전 케이스 · 현실 조건 세이프가드 검증
주~수개월, 출시와 무관한 장기 평가도 염두
왜 제품 발표와 같은 날, 독립 검증의 접근 규칙을 문서로 고정
Lenny’s Newsletter
지표보다 error discovery가 먼저 · criteria drift
트레이스 리뷰→주석→에이전트 active learning
evals-skills 플러그인 · Shopify/Cursor/Ramp/Harvey 사례
왜 에이전트 제품 PM을 위한 이밸 1단계(실패 발견) 실무 가이드
Latent Space
Artificial Analysis 오픈 웨이트 지수 선두(46)로 데뷔 정리
옴니모달·MIT·기술보고서·RL 환경/레시피 공개
큰 배치·멀티태스크 환경·그레이더로 RL 스케일링 해석
왜 오픈 RL 환경이 새 스케일링 레버라는 커뮤니케이터 신호
Simon Willison
state→Noul/choice/score · 입력만 ~$0.042/M
분류·라우팅·리랭킹 적소 · 숫자-only 블랙박스·편향 경고
데모·오픈웨이트 클론·JevBench 일주일 생태계
왜 결정 모델의 API·경제성·한계를 고정한 1차 실무 해설
프로토타입 · GeekNews 스타일 카드 피드 · 점수/댓글 없음