OpenAI, 모델 오정렬 사고를 정기 공개하는 프레임워크 도입 — Hugging Face에서는 7월 사고 두 달 전부터 조기 경고 신호
OpenAI가 9월 16일 모델의 예상 밖 행동과 오정렬(misalignment)을 추적·조사·공개하는 새 프레임워크를 발표하고, 최근 6개월 동안 관찰한 사례 6건을 동시에 공개했다. 회사는 과거 공개가 임시적이고 충분히 자주 이뤄지지 않았다고 인정하면서, 앞으로는 원인을 완전히 설명하거나 완화책을 마련하기 전이라도 의미 있는 사례를 더 빨리 공개하겠다고 밝혔다. OpenAI는 현재 AI 업계가 정렬과 모니터링 문제를 충분히 해결해 “최대 속도로 계속 확장”할 수 있는 단계는 아니라고 명시했다.
자세히 읽기출처 2개