토큰 단가 넘어 ‘일을 얼마에 끝내나’…AI 경쟁의 새 계산법

오픈AI·앤트로픽·구글, 성능과 비용 효율 경쟁…중국 오픈웨이트 확산에 업무별 모델 선택·운영 역량 부상

[테크수다 기자 도안구 eyeball@techsuda.com] AI 모델 경쟁의 기준이 벤치마크 점수와 토큰 단가에서 실제 업무를 완료하는 데 드는 총비용으로 넓어지고 있다. 오픈AI와 앤트로픽이 잇따라 성능과 효율을 높인 모델을 내놓은 가운데 구글도 새로운 프런티어 모델을 발표했다. 중국 오픈웨이트 모델까지 선택지에 들어오면서 기업의 과제는 더욱 구체적으로 바뀌었다. 업무에 필요한 품질과 보안을 충족하면서 가장 경제적으로 결과를 만드는 모델을 골라야 한다. 국내 클라우드 사업자에게도 모델 공급을 넘어 선택·평가·운영·정산을 묶는 역량이 중요해지고 있다.

핵심 요약

  • 일부 모델의 가격대 중첩 — GPT-6.1 솔의 기본 입력·출력 가격은 100만 토큰당 2달러·10달러로, 구글이 발표한 제미나이 4 아르곤의 도입가와 같다. 아르곤의 도입 기간 이후 가격은 오퍼스 5.5와 같은 4달러·20달러다. 다만 이용 가능 대상과 과금 조건은 다르다.
  • 경제성 평가 기준의 확대 — 토큰 과금은 계속되지만 모델을 고르는 기준은 작업당 비용으로 넓어진다. 추론 토큰과 도구 호출, 실패·재시도·사람의 검수까지 포함해야 실제 업무 경제성을 비교할 수 있다.
  • 업무별 모델 선택의 중요성 — 중국 오픈웨이트 사용 확대와 글로벌 클라우드의 라우팅 서비스가 맞물리고 있다. 국내 CSP의 기회는 고객 업무에 맞는 모델 조합을 검증하고, 데이터 처리 위치와 보안 요건을 지키면서 총비용을 낮추는 데 있다.

2달러·10달러에서 겹친 오픈AI와 구글의 가격표

오픈AI는 9월 3일 GPT-6 아스트라(Astra)에 이어 22일 GPT-6 솔(Sol)·루나(Luna), 29일 GPT-6.1 솔을 출시했다. 앤트로픽은 22일 클로드 오퍼스 5.5(Claude Opus 5.5)를 선보였다. 구글은 30일 제미나이 4 아르곤(Gemini 4 Argon)을 발표했다. 아르곤은 신뢰할 수 있는 사이버 방어 기관 등에 먼저 제공하는 단계로, 일반 개발자와 기업 대상 공개를 준비하고 있다.

각 회사의 가격표에서는 고성능 모델을 더 낮은 비용으로 공급하려는 전략이 드러난다. GPT-6.1 솔의 표준 API 가격은 입력 100만 토큰당 2달러, 출력 10달러다. GPT-6 아스트라의 10달러·50달러와 비교하면 각각 5분의 1이다. 대량 처리용 GPT-6 루나는 입력 0.1달러, 출력 0.5달러다. 이 가격은 입력 27만2000토큰 이하 조건이며, 장문 입력이나 처리 등급에 따라 달라진다.

구글이 발표한 아르곤의 도입가도 입력 2달러·출력 10달러다. 캐시 입력에는 일반 입력보다 95% 낮은 가격을 적용한다. 다만 도입 기간이 끝나면 입력 4달러·출력 20달러가 된다. 앤트로픽 오퍼스 5.5의 기본 가격은 입력 4달러·출력 20달러다.

일부 모델의 가격대가 겹친다고 전체 시장의 가격이 수렴했다고 보기는 이르다. 도입가와 정가가 섞여 있고, 이용 가능 대상과 처리 조건도 다르다. 같은 가격표를 제시하더라도 실제 업무에 필요한 토큰 수와 완료율이 다르면 최종 비용은 달라진다.

캐시 가격도 중요한 변수다. GPT-6.1 솔의 캐시 입력은 100만 토큰당 0.1달러로 일반 입력보다 95% 저렴하다. 앞서 출시한 GPT-6 솔의 캐시 입력 0.2달러보다도 낮다. 긴 문서나 코드 문맥을 반복해서 참조하는 에이전트에서는 기본 입력 단가뿐 아니라 캐시 적중률과 쓰기 비용을 함께 계산해야 한다.

싼 토큰이 싼 업무를 보장하지 않는다

앤트로픽은 오퍼스 5.5가 전작보다 토큰 단가를 20% 낮추고 작업에 필요한 토큰도 줄여, 기본 설정의 일반적인 워크로드에서 비용을 40% 절감했다고 밝혔다. 특정 코딩 평가인 FrontierCode에서는 기본 추론 강도로 아스트라의 최고 점수를 넘으면서 작업당 비용은 약 5분의 1이었다고 설명했다. 앤트로픽이 제시한 평가 결과다.

오픈AI도 GPT-6.1 솔의 경제성을 앞세웠다. 과학 연구 작업을 평가하는 Terminal-Bench Science 0.1에서 최대 추론 강도 기준 평균 작업당 비용이 5.47달러였다고 밝혔다. 비교 대상으로 제시한 오퍼스 5.5는 23.21달러, 아스트라는 23.80달러였다. 다만 같은 평가에서 가장 높은 성능 점수는 아스트라가 기록했다. 오픈AI는 경쟁 모델 결과를 공개 보고서에서 가져왔다고 명시했다.

이 수치들은 특정 시험에서의 결과다. 평가 과제와 실행 환경, 추론 강도, 도구 구성에 따라 결과가 달라진다. 평균 시도 비용이 낮다고 성공적으로 완료한 업무 한 건의 비용까지 낮다고 단정할 수도 없다. 기업은 같은 업무와 품질 기준 아래에서 실패와 재시도, 사람의 검수에 들어가는 비용을 함께 측정해야 한다.

구글의 제미나이 3.8 플래시는 이런 차이를 보여준다. 구글은 이 모델이 복잡한 작업에서 추가 추론과 반복적인 도구 호출을 수행하며, 특히 높은 추론 강도에서는 토큰을 더 많이 사용할 수 있다고 설명했다. 효율을 우선하는 업무에는 추론 강도를 낮추거나 기존 3.7 플래시를 활용할 수 있다고 안내했다.

3.8 플래시의 도입가는 입력 0.75달러·출력 3.75달러이며, 2027년 1월 1일부터 각각 1.5달러·7.5달러가 적용된다. 지금의 단가뿐 아니라 도입가 종료 이후의 비용도 검토해야 하는 이유다.

중국 오픈웨이트, 선택지와 배포 방식을 넓히다

중국 오픈웨이트 모델의 확산은 기업이 선택할 수 있는 가격과 배포 방식의 폭을 넓히고 있다. 오픈웨이트는 모델 가중치를 공개해 외부 사업자가 직접 운영할 수 있도록 하는 방식이다. 다만 공개 범위와 상업적 이용 조건은 모델마다 다르다.

오픈라우터(OpenRouter)가 공개한 자료에 따르면 2026년 8월 미국에서 발생해 자사 플랫폼으로 들어온 요청의 토큰 가운데 약 60%가 오픈웨이트 모델로 향했다. 오픈라우터는 중국 연구소의 모델이 해당 물량의 대부분을 차지한다고 설명했다. 이 통계는 오픈라우터 내부의 이용 현황이며, 미국 전체 AI 시장 점유율을 뜻하지 않는다.

딥시크는 9월 V4.1 플래시를 선보이며 추론과 캐시 효율을 강조했다. 현재 공식 가격표상 캐시 미적중 입력은 100만 토큰당 비혼잡 시간대 0.15달러, 혼잡 시간대 0.3달러다. 출력은 각각 0.6달러와 1.2달러다. 구형 Flash 계열 요청은 V4.1 Flash로 전환하지만, V4 Pro는 별도 모델과 요금으로 제공한다.

오픈웨이트와 폐쇄형 모델의 성능 차이도 지속적인 비교 대상이다. Epoch AI는 지난 5월 발표한 분석에서 2026년 1월 이후 분석 구간의 최상위 오픈웨이트 모델이 폐쇄형 선두 모델에 평균 약 4개월 뒤처졌다고 추정했다. 이는 당시 분석 구간과 평가 방법에 따른 결과로, 9월 말 모델들의 격차를 직접 나타내는 수치는 아니다.

오픈웨이트 도입에서는 라이선스도 비용 구조의 일부다. 문샷AI의 Kimi K3 라이선스는 일정 매출 요건을 충족하는 모델 서비스(MaaS) 사업자에 별도 상업 계약을 요구하며, 내부 사용 등에는 예외를 둔다. 모델을 직접 운영해 외부 고객에게 제공하려는 CSP는 성능과 GPU 비용뿐 아니라 상업적 제공 조건까지 확인해야 한다.

중국 모델의 사용량 확대를 곧바로 미국 폐쇄형 모델의 대체로 해석할 필요는 없다. 기업에 더 중요한 질문은 특정 업무에서 필요한 품질을 충족하는지, 어떤 환경에서 운영할 수 있는지, 검수와 재작업을 포함한 총비용이 얼마인지다.

‘알아서 모델을 고르는 능력’은 이미 상품이다

모델 선택지가 늘면서 업무에 적합한 모델을 자동으로 배정하는 라우팅도 서비스로 자리 잡고 있다. 다만 같은 라우팅이라는 이름 아래에서도 선택 범위와 목적은 다르다.

AWS 베드록의 Intelligent Prompt Routing은 같은 모델 제품군 안에서 두 모델을 선택해 품질과 비용을 조정한다. AWS는 정확도를 유지하면서 비용을 최대 30% 줄일 수 있다고 설명한다. 서로 다른 벤더의 모델을 자유롭게 넘나드는 기능과는 구분해야 한다.

마이크로소프트 파운드리의 Model Router는 여러 공급자의 지원 모델 가운데 요청에 적합한 모델을 선택한다. 비용·품질·균형 모드를 제공하며, 실제 선택 범위에는 접근권과 배포 지역 등의 조건이 적용된다. MS도 고객 업무에서 기존 방식보다 비용과 품질이 개선되는지 직접 평가할 것을 권고한다.

자동 전환이 반드시 비용 절감을 뜻하는 것은 아니다. 앤트로픽은 오퍼스 5.5의 일부 사이버보안 작업을 안전정책에 따라 오퍼스 4.8로 전환한다고 밝혔다. 기업은 어떤 모델이 선택됐는지와 함께 비용, 품질, 장애 대응, 안전정책 중 무엇이 전환을 결정했는지도 추적할 수 있어야 한다.

라우팅의 가치는 모델을 바꿔 호출하는 기능에서 끝나지 않는다. 업무별 품질 기준과 비용 한도를 정하고, 저렴한 모델의 결과가 기준에 못 미치면 상위 모델이나 사람에게 넘기며, 최종 결과까지 기록하는 운영 체계가 필요하다.

MS, 자체 모델로 효율 경쟁에 가세

무스타파 술레이만(Mustafa Suleyman) 마이크로소프트 AI CEO

마이크로소프트는 자체 모델 개발로 선택지를 넓혔다. 6월 빌드 2026에서 MAI-Thinking-1과 코딩용 MAI-Code-1-Flash 등을 발표했다. MAI-Thinking-1은 활성 매개변수 350억 개 규모의 전문가 혼합(MoE) 추론 모델이다.

MS 자체 평가에서 MAI-Code-1-Flash는 SWE-Bench Pro에서 51.2%를 기록해 Haiku 4.5의 35.2%를 앞섰다. 별도 평가인 SWE-Bench Verified에서는 토큰을 최대 60% 적게 사용했다고 밝혔다. 두 수치는 서로 다른 평가에서 나온 결과다.

이런 움직임은 플랫폼 사업자가 외부 모델의 유통뿐 아니라 자체 모델 개발과 모델 선택 기능에도 투자하고 있음을 보여준다. 업무에 맞춘 모델을 직접 보유하면 성능 개선과 비용 최적화를 함께 시도할 수 있다. 독립 사업자와 국내 CSP가 경쟁해야 할 대상도 단순한 모델 판매자를 넘어선다.

국내 CSP, 연결·과금에 업무 검증을 더해야

국내 모델 개발사와 클라우드 서비스 사업자들도 이 문제를 주목하고 있다. 관건은 사업 구상이 실제 고객의 비용 절감과 안정적인 업무 처리로 이어지느냐다. 모델을 연결하고 사용량을 합산하는 기능만으로는 글로벌 게이트웨이와 차별화하기 어렵다. 고객 업무에서 요구하는 품질을 평가하고, 데이터 처리 위치와 접근 통제를 지키며, 장애와 재작업까지 포함한 운영 비용을 낮춰야 한다.

서비스 구성에는 국산 모델, 국내 인프라에 직접 올린 오픈웨이트, 해외 사업자의 API가 함께 들어갈 수 있다. 그러나 세 방식의 통제 범위는 다르다. 해외 API를 연결했다고 국내에서 추론하는 것은 아니며, 국내에 게이트웨이를 뒀다고 모든 데이터가 국내에 머무는 것도 아니다.

오픈라우터 역시 데이터 지역성을 검토할 때 요청이 어디서 복호화·처리되는지, 연동 도구는 어디서 실행되는지를 함께 확인해야 한다고 설명한다. 모델 개발사의 국적과 실제 데이터 처리 위치를 구분해야 한다는 의미다.

국내 CSP의 차별화 가능성은 고객 업무에 맞춘 검증과 운영에 있다. 한국어 문서 처리와 공공·기업 내부 업무에서 필요한 품질 기준을 정하고, 허용된 모델과 인프라 안에서 비용을 최적화하는 방식이다. 고객이 구매하는 것은 모델 이름이 아니라 안정적으로 완료된 업무라는 관점이 필요하다.

테크수다의 시각

9월의 모델 발표가 보여준 변화는 AI의 성능 경쟁에 업무 경제성이라는 평가축이 더해졌다는 점이다. 토큰 과금은 계속된다. 그러나 구매자가 판단해야 할 숫자는 토큰 단가에서 완료율, 전체 토큰 사용량, 재시도, 사람의 검수와 수정 비용으로 넓어지고 있다.

구글을 경쟁에서 밀려난 사업자로 단정하기도 어렵다. 구글은 플래시 계열의 효율과 성능을 개선하면서 아르곤으로 복잡한 전문 업무에서의 경쟁력을 강조했다. 다만 아르곤은 단계적으로 제공되고 있고, 발표된 가격은 도입가다. 실제 고객 업무에서의 품질과 총비용, 정가 적용 이후의 경제성을 함께 지켜봐야 한다.

국내 CSP에는 국산 모델 개발과 다양한 모델의 활용을 함께 바라보는 전략이 필요하다. 국산 모델, 국내에서 운영하는 오픈웨이트, 해외 API를 업무 특성에 맞게 조합하되 데이터 주권과 보안 요구를 충족해야 한다. 국산 모델의 경쟁력도 한국어·공공·산업별 업무에서의 정확도와 운영 비용으로 구체적으로 증명할 수 있다.

이 시장은 비어 있지 않다. 글로벌 클라우드는 이미 모델 선택과 운영 기능을 상품화했고, MS는 자체 모델도 개발하고 있다. 국내 사업자가 확보해야 할 것은 고객 업무에 대한 이해, 모델별 성능을 비교할 평가 데이터, 실제 운영에서 비용을 줄인 기록이다.

접근권과 계약 조건도 경쟁력의 일부다. 어떤 모델을 어느 지역에서 어떤 조건으로 제공할 수 있는지에 따라 서비스 구성이 달라진다. 모델을 많이 연결하는 것만큼 고객의 데이터를 어디서 처리하고, 문제가 생기면 누가 책임지며, 결과를 어떻게 검증하는지 설명할 수 있어야 한다.

결국 비교해야 할 지표는 성공적으로 완료한 업무 한 건당 총비용이다. 전체 시도에 사용한 모델·도구·인프라 비용에 사람의 검수와 재작업 비용을 더하고, 이를 성공적으로 완료한 업무 수로 나눠야 한다. 이 숫자를 고객에게 보여주고 지속적으로 낮출 수 있는 사업자가 AI 도입의 경제적 가치를 증명할 것이다.

오픈AI·앤트로픽·구글, 성능과 비용 효율 경쟁, 이런 점이 궁금하셨나요?

Q. 고성능 AI 모델 가격은 얼마나 내려갔나?

A. GPT-6.1 솔의 기본 입력·출력 가격은 100만 토큰당 2달러·10달러로, 아스트라의 10달러·50달러 대비 각각 5분의 1이다. 구글 아르곤도 같은 도입가를 발표했지만 이후에는 4달러·20달러가 적용된다. 모델별 성능과 이용 조건이 달라 가격만으로 경제성을 판단할 수는 없다.

Q. ‘작업당 비용’은 왜 중요한가?

A. 모델마다 같은 일을 처리하는 데 필요한 토큰과 도구 호출, 재시도 횟수가 다르기 때문이다. 토큰 단가가 낮아도 실패하거나 사람이 많이 수정해야 하면 총비용은 커진다. 동일한 업무와 품질 기준에서 성공적으로 완료한 한 건의 비용을 비교해야 한다.

Q. 중국 오픈웨이트는 미국 폐쇄형 모델을 대체하나?

A. 일부 플랫폼에서는 오픈웨이트 사용 비중이 크게 늘었지만, 이를 전체 시장의 대체로 단정할 수는 없다. 업무별 성능과 배포 환경에 따라 함께 활용할 수 있다. 가중치 공개 여부와 별개로 상업적 이용 조건도 확인해야 한다.

Q. 국내 클라우드 사업자의 기회는 어디인가?

A. 고객 업무에 맞는 모델을 선택하고 품질을 검증하며, 데이터 처리 위치와 보안을 관리하면서 총비용을 낮추는 데 있다. 실제 차별성은 고객 업무의 완료율과 비용 절감 성과로 입증해야 한다.

[테크수다 기자 도안구 eyeball@techsuda.com]

Newsletter
디지털 시대, 새로운 정보를 받아보세요!

테크가 전 산업 영역에 스며드는 소식에 관심이 많다. 1999년 정보시대 PCWEEK 테크 전문지 기자로 입문한 후 월간 텔레닷컴, 인터넷 미디어 블로터닷넷 창간 멤버로 활동했다. 개발자 잡지 마이크로소프트웨어 편집장을 거쳐 테크수다를 창간해 지금까지 활동하고 있다. 태블릿을 가지고 얼굴이 꽉 찬 방송, 스마트폰을 활용한 현장 라이브를 한국 최초로 진행했다.