GPT‑5.6 가격 인하·ARC‑AGI‑3 3배 상승|성능과 비용이 함께 바뀌었다

GPT‑5.6 Sol의 ARC‑AGI‑3 공개 세트 점수는 기본 공식 실행에서 13.3%였지만, 추론 상태 유지와 문맥 압축을 적용하자 38.3%로 높아졌습니다. 모델 자체가 갑자기 바뀐 것이 아니라 작업 중간의 판단을 보존하고 불필요한 문맥을 줄인 실행 방식이 성능 차이를 만들었습니다. 이번 결과는 AI 모델을 고를 때 모델명뿐 아니라 메모리와 실행 구조까지 함께 봐야 한다는 점을 보여줍니다.
무엇이 발표됐나요?
OpenAI는 2026년 7월 29일 GPT‑5.6 Sol을 ARC‑AGI‑3 공식 하네스에서 다시 평가한 결과를 공개했습니다. 기본 설정의 공개 세트 점수는 13.3%였고, retained reasoning과 compaction을 함께 사용한 구성에서는 38.3%를 기록했습니다.
OpenAI가 같은 글에서 제시한 인간 참가자 평균 추정치는 48%입니다. 개선된 결과도 인간 평균에는 미치지 못하지만, 모델을 바꾸지 않고 실행 구조를 조정해 점수가 크게 달라졌다는 점이 핵심입니다.
ARC‑AGI‑3는 어떤 시험인가요?
ARC‑AGI‑3는 정답 형식을 미리 알려주는 일반적인 문제풀이 시험과 다릅니다. AI가 낯선 상호작용 환경을 탐색하면서 목표와 규칙을 추론하고, 실패한 행동에서 배워 다음 전략을 바꾸는 능력을 평가합니다.
따라서 한 번의 답변 정확도보다 긴 작업 과정에서 무엇을 기억하고 언제 전략을 수정하는지가 중요합니다. 코딩 에이전트나 업무 자동화처럼 여러 단계를 이어서 수행하는 시스템과 가까운 평가 방식입니다.
점수가 오른 두 가지 이유
추론 상태 유지
에이전트가 이전 단계에서 세운 가설과 실패 원인을 다음 단계에서도 사용할 수 있게 했습니다. 매 단계마다 처음부터 다시 생각하는 현상을 줄여, 이미 확인한 정보를 반복 탐색하는 비용을 낮춥니다.
문맥 압축
작업 기록이 길어질 때 모든 내용을 그대로 쌓지 않고 다음 판단에 필요한 정보 중심으로 압축했습니다. 긴 문맥에서 중요한 단서가 묻히는 문제를 줄이면서 더 오래 작업할 수 있게 한 것입니다.
X와 Reddit에서는 무엇이 달랐나요?
OpenAI 공식 X 계정과 개발자 계정은 GPT‑5.6 Sol이 자체 추론 효율과 실제 서비스용 GPU 커널을 개선하는 데 활용됐다고 설명했습니다. 이는 벤치마크 점수뿐 아니라 모델을 운영하는 비용과 속도에도 같은 실행 구조가 연결될 수 있다는 공식 설명입니다.
반면 Reddit에는 정식 공개 전 출시일, 제공 지역, 모델 선택기에 나타난 이름을 둘러싼 추측이 여러 차례 올라왔습니다. 이런 글은 관심이 빠르게 커지는 신호로는 유용하지만, 출시 여부와 성능 수치를 확정하는 근거로 사용할 수는 없습니다. 실제 기사에서는 공식 발표 이후 확인된 내용과 사용자 관찰을 구분해야 합니다.
GPT‑5.6 토큰 가격은 얼마나 낮아졌나요?
OpenAI는 GPT‑5.6 출시 당시 100만 토큰 기준 가격을 Sol 입력 5달러·출력 30달러, Terra 입력 2.50달러·출력 15달러, Luna 입력 1달러·출력 6달러로 발표했습니다. 이후 2026년 7월 30일부터 Terra와 Luna 가격을 다시 낮췄습니다.
- GPT‑5.6 Sol: 입력 5달러·출력 30달러로 유지됐습니다.
- GPT‑5.6 Terra: 입력 2.50달러에서 2달러, 출력 15달러에서 12달러로 각각 20% 인하됐습니다.
- GPT‑5.6 Luna: 입력 1달러에서 0.20달러, 출력 6달러에서 1.20달러로 각각 80% 인하됐습니다.
캐시된 입력 가격은 Terra가 0.20달러, Luna가 0.02달러입니다. Sol 가격은 바뀌지 않았으므로 “GPT‑5.6 전체 가격 인하”라고 표현하기보다 “Terra·Luna 가격 인하”라고 구분하는 것이 정확합니다.
왜 고성능 Sol이 아니라 Terra·Luna 가격을 내렸을까요?
Sol은 가장 복잡한 장기 추론과 최고 성능이 필요한 작업에 배치되고, Terra와 Luna는 반복 호출이 많은 대중적 자동화에 투입되는 계층입니다. 가격 인하는 기업과 개발자가 모든 작업을 Sol에 맡기지 않고 난이도에 따라 모델을 나누도록 유도하는 전략으로 해석할 수 있습니다.
OpenAI는 구독료와 ChatGPT·Codex의 할당량은 그대로 유지하되 Terra와 Luna 사용 시 소비되는 크레딧을 줄였다고 밝혔습니다. 즉 이번 조정은 소비자 구독료 인하가 아니라 API와 작업별 연산 비용을 낮추는 변화입니다.
실제 자동화 비용에는 어떤 차이가 생기나요?
예를 들어 한 달에 입력 1억 토큰과 출력 2천만 토큰을 Luna로 사용한다고 가정하면 출시 가격 기준 비용은 220달러였습니다. 인하된 가격을 적용하면 입력 20달러와 출력 24달러, 총 44달러로 줄어듭니다. 같은 사용량에서 176달러가 감소하는 구조입니다.
Terra는 같은 조건에서 550달러에서 440달러로 내려갑니다. 실제 청구액은 캐시 사용량, 긴 문맥 요금, 도구 호출 비용에 따라 달라지지만 대량 뉴스 분류·중복 검사·초안 구조화 같은 반복 작업에는 가격 인하 효과가 직접 반영됩니다.
성능 개선과 가격 인하를 함께 봐야 하는 이유
ARC‑AGI‑3 결과는 같은 Sol 모델도 추론 상태 유지와 문맥 압축에 따라 성능이 크게 달라진다는 점을 보여줍니다. Terra·Luna 가격 인하는 그 실행 구조를 더 많은 반복 업무에 적용할 수 있게 만듭니다. 최고 모델 하나를 계속 호출하는 방식보다 어려운 판단은 Sol, 대량 전처리와 반복 작업은 Terra·Luna로 분리하는 구조가 비용 대비 성능에 유리해졌습니다.
일반 사용자는 무엇을 확인해야 하나요?
- 긴 작업에서 이전 판단과 실패 원인이 다음 단계에 유지되는지 확인합니다.
- 문맥이 길어졌을 때 전체 대화를 반복 전달하지 않고 핵심 상태를 압축하는지 봅니다.
- 벤치마크 최고 점수만 보지 말고 사용한 도구, 추론 예산, 실행 설정을 함께 확인합니다.
- 같은 모델이라도 단발 질문과 장시간 에이전트 작업의 성능이 다를 수 있음을 고려합니다.
AI 자동화에는 어떤 의미가 있나요?
뉴스 수집과 블로그 작성 자동화에서도 같은 원리가 적용됩니다. 이미 확인한 출처, 제외한 루머, 기존 글과의 중복 판단을 다음 실행에 보존해야 매번 같은 조사를 반복하지 않습니다. 수집한 원문 전체를 계속 쌓기보다 주장·근거·날짜·신뢰도만 압축해 전달하면 무료 모델의 제한된 문맥도 효율적으로 사용할 수 있습니다.
결국 좋은 자동화는 더 비싼 모델만 호출하는 구조가 아니라, 조사 기록과 검증 결과를 잃지 않는 구조에 가깝습니다. 이번 시험 결과는 무료 기반 자동화에서도 상태 저장과 문맥 압축을 우선 설계해야 하는 이유를 보여줍니다.
확인한 자료
- OpenAI의 ARC‑AGI‑3 재평가 설명
- ARC Prize의 GPT‑5.6 Sol 결과
- OpenAI 공식 X 게시물
- OpenAI의 GPT‑5.6 가격·성능 조정 발표
- OpenAI API 공식 가격표
관련 소식
FAQ
GPT‑5.6 Sol의 모델 자체가 업데이트된 건가요?
이번 비교의 핵심은 새 모델 교체가 아니라 같은 모델을 실행하는 방식입니다. 추론 상태 유지와 문맥 압축 설정을 적용했을 때 공개 세트 점수가 달라졌습니다.
38.3%가 인간보다 높은 점수인가요?
아닙니다. OpenAI가 공식 플레이 기록을 바탕으로 추정한 인간 평균은 48%였습니다. 개선 폭은 크지만 인간 평균에는 아직 미치지 못했습니다.
GPT‑5.6 모든 모델의 가격이 내려갔나요?
아닙니다. Sol은 입력 5달러·출력 30달러로 유지됐고, Terra는 20%, Luna는 80% 인하됐습니다. 가격은 100만 토큰 기준입니다.
이 결과가 블로그 자동화와 무슨 관련이 있나요?
자동화가 이전 조사와 검증 결과를 보존하고 긴 원문을 핵심 정보로 압축하면 같은 무료 모델로도 반복 조사와 문맥 낭비를 줄일 수 있다는 점에서 직접 관련됩니다.
← 허브로 돌아가기