한눈에
OpenAI가 보호된 추론(protected reasoning)을 빼내려 한 조직적 캠페인을 적발하고 막았다고 공개했습니다. 암호화나 DB를 뚫은 해킹이 아니라, 모델 대화를 조작해 숨은 추론을 보이게 만든 유형입니다.
핵심 클러스터 일부는 Moonshot AI(Kimi) 관련 인물로 귀속한다고 적혀 있습니다. 숫자·대응·업계 공유까지 한 번에 정리한 1차 보안 글입니다.
배경
프론티어 모델은 최종 답과 별도로, 문제를 푸는 내부 기록을 갖습니다. 그걸 대량으로 뽑으면 다른 모델을 싸게 흉내 내거나, 원래 붙혀 둔 보호장치를 빼고 능력만 옮길 수 있습니다.
DevDay·Astra 6.1 철회 주와 겹칩니다. “에이전트가 선을 넘는다” 이야기 옆에, “추론 자체를 훔친다”는 축이 같이 열린 셈입니다.
무슨 일 / 핵심 내용
공격은 한 대화의 암호화된 추론을 다른 대화로 옮겨 “복호화·전사”를 시키는 식의 새로운 패턴을 포함했다고 합니다. 독립 보안 연구자의 책임 공개로 교차 모델·대화 압축 취약점도 확인했고, 같은 공격 부류로 봤습니다.
타임라인은 이렇습니다. 7월 1일 낮은 볼륨으로 시작. 7월 24–25일 관련 추출 패턴 요청 약 1만 6천 건, 사용자 4천 명 넘게 스파이크. 추가 조사로 관련 프롬프트 패턴이 1만 5천 명 이상 클러스터로 이어졌고, 7월 28일까지 전면 차단.
대응은 계정 제재, 가입·인프라 통제, 숨은 추론 보호 강화입니다. 다른 사용자 암호화 추론을 이미 가진 사람이 재실행해 내용을 복구하는 경로를 닫았고, 스트리밍 중 추론이 샐 수 있는 출력을 잡아두는 검사도 넣었습니다. 서드파티를 거친 트래픽은 해당 제공자와 같이 끊었습니다.
Frontier Model Forum과 정부 정보공유 채널에도 넘겼습니다. 휴대·재실행 가능한 추론 아티팩트를 쓰는 시스템은 비슷한 위험에 노출될 수 있다고 경고합니다.
숫자·스펙
- 최초 관측: 7월 첫째 주. 전면 차단: 7월 28일.
- 7/24–25 스파이크: 관련 패턴 요청 ~16,000 (시도 기준), 사용자 4,000+.
- 관련 프롬프트 패턴 클러스터: 사용자 15,000+.
- 귀속: 핵심 클러스터를 Moonshot AI(Kimi) 연관으로 평가. 전부가 단일 행위자인지는 불명확.
왜 중요한가
“모델 가중치를 훔친다”가 아니라 “추론 궤적을 훔친다”는 현실적인 증류 공격을 랩이 공개한 기록입니다. 가드레일이 붙은 출력만 보고 학습하는 것과, 숨은 추론까지 가져가는 것은 위험이 다릅니다.
업계 공유도 같이 갑니다. OpenAI만의 버그가 아니라고 명시하고, Forum에 넘겼습니다. 파트너 호스팅·툴 출력 쪽 방어가 lagged 있다는 자평도 있습니다.
그래서 뭐
빌더는 추론·CoT를 로그에 남기거나 재실행 가능하게 만들 때 접근 통제를 다시 봐야 합니다. “암호화돼 있으니 괜찮다”는 이번 사례에서 깨졌습니다.
제품 쪽은 숨은 추론 노출 경로(스트리밍, 대화 간 복사, 툴 출력)를 점검 체크리스트에 넣는 날이 됐습니다.