**오픈AI(OpenAI)**가 신형 모델 GPT-6 아스트라에 대한 “출시 후 멍청해졌다”는 일주일간의 이용자 불만을 인정하고, 이를 초래한 세 가지 결함을 수정했다고 밝혔다. 동시에 코덱스(Codex) 구독자의 사용량 한도도 재설정했다.

핵심 내용

  • 아스트라 이용자들은 출시 직후 버전과 현재 버전을 나란히 비교 테스트하며, 모델이 조용히 ‘너프(성능 하향)’됐다고 주장해 왔다.

  • 오픈AI 코덱스 총괄 티보 소티오(Tibo Sottiaux)는 세 가지 원인을 공개했는데, 그 중 하나는 약 4천~5천 명이 참여한 컨텍스트 실험이었다.

  • 전작 플래그십 모델 GPT-5.6 솔(Sol)도 7월에 동일한 의혹에 휩싸인 바 있다.

오픈AI, 아스트라 품질 결함 긴급 패치

코덱스 제품 총괄 티보 소티오는 토요일(현지시간) 공개된 업데이트를 통해, 팀이 이용자들과 함께 결함을 추적한 뒤 수정 패치를 배포하고 자정 전에 사용량 한도를 전면 초기화했다고 설명했다.

그는 이전 세대 모델용으로 설계된 ‘스킬(skill)’들이 아스트라에서도 과도하게 발동되면서, 모델이 스스로 결과를 재검증하는 절차를 가로막는 경우가 있었다고 밝혔다.

선택 옵션이었던 ‘컨텍스트 관리 실험’도 문제였다. 이 실험 기능이 켜진 상태에서는 모델이 대화를 너무 일찍 종료하거나, 이미 오래된 메시지에 답변하는 사례가 반복됐다. 오픈AI는 이 실험에 노출된 이용자가 약 4천~5천 명에 달했다고 추산하며, 시험 기능을 전면 비활성화했다.

또 일부 엔진 설정이 잘못 구성돼, 그 엔진을 통해 라우팅된 ‘꼬리 트래픽(tail traffic)’의 답변 품질이 통계적으로 유의미하게 떨어졌던 것으로 드러났다. 회사는 해당 엔진들을 제거하고, 여러 가지 소규모 수정을 병행했다. 소티오는 이후 게시글을 통해 “아스트라가 이제 이용자의 ‘마지막 메시지’를 더 정확히 추적한다”고 했다.

함께 보기: 이더리움, ETF 자금 2억1,600만달러 유입에도 2,800달러 공급벽 부담

개발자들 “코딩 능력 퇴보”…아스트라 회피 움직임

논란은 X(구 트위터)에서 일주일 내내 확산됐다. 개발자들은 아스트라 출시 당일과 현재 버전에 동일한 프롬프트, 동일한 설정을 적용해 코드를 생성한 뒤, 결과를 나란히 비교했다.

불과 며칠 전까지 아스트라를 극찬했던 개발자 **프란잘 팔리왈(Pranjal Paliwal)**은, 모델이 자신을 위해 작성한 코드를 다시 검토한 후 “진보가 아니라 퇴보”라고 평가를 뒤집었다.

코딩 툴 ‘오픈코드(Opencode)’를 개발하는 **댁스 라드(Dax Raad)**는, 아스트라로 갈아탄 뒤 비용이 두 배로 뛰었지만 체감 성능은 오히려 떨어졌다고 판단해 팀 전체를 다시 구형 GPT-5.6 솔로 되돌렸다.

오픈AI 커뮤니티의 한 이용자는 게시글에서, 보고서를 통해 “지금의 아스트라는 같은 작업, 같은 재시도 조건에서 솔과 성능이 거의 비슷한 수준”이라고 분석했다. 다만 모든 이가 이에 동의하는 것은 아니다. ‘안티키테라(Antikythera)’라는 필명을 쓰는 또 다른 이용자는 “아스트라는 원래부터 게으르고 글머리표(불릿 포인트)를 남발했으며, 이용자들이 이제야 환상이 깨진 것”이라고 반박했다.

GPT-6 아스트라를 짓누르는 연산·요금 한도

연산(capacity) 이슈는 아스트라가 9월 초 대규모 공개에 들어간 순간부터 그림자처럼 따라붙었다.

이용자들의 제보에 따르면, 오픈AI는 헤비 유저로 분류되는 일부 ChatGPT 계정의 아스트라 사용 한도를 크게 줄였고, 월 200달러짜리 신규 프로(Pro) 구독도 일시 중단했다. 이 조치는 소티오가 9월 10일자 블로그 글에서 공식 확인했다.

현재 아스트라 요금은 입력 토큰 100만 개당 10달러, 출력 토큰 100만 개당 50달러로 책정돼 있다. 이는 출시 당시 기준으로 솔이 받던 가격의 2.5배 수준이다. 고성능 모델임을 감안해도, 비용 대비 효용에 대한 논쟁이 커지는 배경이다.

이번 논란은 불과 두 달 사이에 오픈AI 플래그십 모델이 두 번 연속 같은 비판을 받은 사례이기도 하다. 7월에는 솔의 최고 난도 추론 모드가 “하룻밤 사이 피상적으로 변했다”는 지적이 터져 나왔고, 당시에도 소티오는 고의적인 성능 하향은 부인하면서 “추론 노력(reasoning effort)에 관한 실험”이 진행 중이었다는 점만 인정했다.

다음 읽을거리: 엔비디아 젠슨 황 “AI 보안 공포, 사이버 보안 업체들에 호재”