AI 결제 승인자가 실세 된 시대…래블업, ‘토큰 관문’으로 비용 통제 시장 공략

클로드·젬마·네모트론 한 경로로 연결…보안·결제 기업도 AI 게이트웨이 확보 경쟁

[테크수다 기자 도안구 eyeball@techsuda.com] 10월 7일 서울 코엑스 ‘AI 페스타 26’ 전시장 래블업 부스. 시연 화면에는 앤쓰로픽 클로드, 구글 젬마, 엔비디아 네모트론 등 여러 AI 모델이 하나의 라우터에 연결돼 있었다. AI 인프라 소프트웨어 기업 래블업(대표 신정규)이 보여준 것은 모델 성능 경쟁과는 다른 문제였다. 어느 모델을 쓸지, 얼마나 쓰게 할지, 그 비용을 누가 통제할지를 모델 앞단의 관문에서 관리하겠다는 구상이다.

핵심 요약

  • 모델 앞단의 토큰 관문 — 외부 상용 모델과 사내 모델을 한 경로로 연결하고, 모델별·앱별 토큰 사용량을 집계해 한도를 건다. 래블업 관계자는 국내 금융사 한 곳이 출시 전 버전을 먼저 도입했다고 설명했다.
  • 에이전트 시대의 비용 관리 — 모델을 반복 호출하는 에이전트가 늘면서 사용량을 추적하고 통제할 필요도 커졌다. 핀옵스재단은 2026년 보고서에서 응답자의 98%가 AI 비용을 관리한다고 밝혔다.
  • 보안·결제 기업의 관문 확보 경쟁 — 팔로알토네트웍스는 포트키 인수를 마쳤고, 스트라이프는 오픈라우터 인수에 합의했다. 오픈소스와 데이터 플랫폼 기업도 토큰 사용량 관리 기능을 제공한다.
신정규 대표가 lab | up > /conf/6에서 기조연설을 진행하던 당시 사진. 전시장에서는 만나지 못했다.

모델을 연결하니, 다음 질문은 ‘얼마나 쓰게 할 것인가’

애플리케이션이 모델마다 따로 요청을 보내는 대신 라우터 하나를 바라본다. 라우터는 요청을 받아 모델로 보내고, 모델별·앱별 사용량을 모은다. 관리자는 그 숫자를 보고 정책을 건다. 모델별로 수백만 토큰 단위의 상한을 정하거나 특정 앱의 하루 사용량을 제한하는 식이다.

김종민 레블업 개발자 관계 담당자는 클로드의 토큰 사용량이 지나치게 늘면 해당 모델 이용을 제한하고 다른 모델로 요청을 돌리는 제어를 할 수 있다고 설명했다. 부서별 권한에 따라 특정 모델 접근을 제한하는 방향도 제시했다. 기업이 AI를 얼마나 쓰는지 확인하는 데서 출발해, 누가 어떤 모델을 어디까지 쓰게 할지 정하는 도구로 넓히겠다는 얘기다.

그의 설명은 결국 결제 문제로 모였다.

“요즘은 회사 최고 권력자가 AI 결제를 승인해 주는 사람이라고들 한다.”

래블업은 그 결제를 좀 더 세밀하게 통제하는 도구를 만들고 있다고 설명했다. 외부 모델의 종량제 요금이 사라지는 것은 아니다. 사용량을 파악하고 이후 호출을 제한하거나 다른 모델을 선택해 지출을 조절하는 방식이다.

래블업은 9월 29일 코엑스에서 연 여섯 번째 기술 콘퍼런스에서 여러 모델을 연결하는 라우터와 토큰 사용량·정책·과금을 중앙에서 관리하는 허브를 소개했다. 회사는 이를 ‘토큰 팩토리’라는 개념으로 묶었다. GPU 연산 자원을 관리해 온 백엔드닷AI(Backend.AI)에서 모델과 토큰 흐름을 관리하는 영역으로 사업을 넓히는 구상이다.

국내 금융사 한 곳은 정식 출시 전 버전을 먼저 도입했다.

채팅에서 에이전트로…반복 호출이 키우는 청구서

김종민 엔지니어는 기업의 관심이 자체 모델 확보에서 외부 모델 활용으로, 다시 사용 비용 관리로 옮겨 왔다고 설명했다. 사람이 질문을 하나씩 입력할 때와 에이전트가 작업을 나눠 모델을 반복 호출할 때는 사용량이 달라진다는 얘기다.

그는 “에이전트는 사람이 쓰는 것의 수십 배를 쓴다”고 말했다. 현장에서 체감하는 사용량 증가를 표현한 설명이다. 모든 에이전트가 같은 배수로 토큰을 소비한다는 뜻으로 일반화할 수는 없다.

비용 관리 조직의 관심이 AI로 옮겨 가는 흐름은 조사에서도 드러난다. 핀옵스재단의 ‘스테이트 오브 핀옵스 2026’ 보고서는 AI 비용을 관리한다는 응답 비율을 2024년 31%, 2025년 63%, 2026년 98%로 제시했다. 2026년 조사 전체에는 1192명이 참여했다. 전 세계 기업 전체의 도입률이 아니라 핀옵스 커뮤니티 조사 결과다.

보고서가 짚은 어려움도 사용량 관제와 맞닿아 있다. 비용을 제대로 파악하는 문제가 가장 앞섰고, 비용 배분과 투자수익률 산정이 뒤를 이었다. 어느 팀이 어떤 모델에 얼마를 썼는지 알아야 예산을 정하고 성과를 따질 수 있다는 얘기다.

* 2026년 FinOps 현황 보고서

2026년 FinOps 현황 보고서 중 AI 비용 관리 관심도

보안 회사는 포트키, 결제 회사는 오픈라우터

해외에서는 모델 앞단의 관문을 확보하려는 인수 움직임이 이어졌다.

팔로알토네트웍스는 5월 29일 포트키 인수를 마무리했다. 회사는 포트키를 AI 보안 플랫폼 ‘프리즈마 AIRS’의 핵심 AI 게이트웨이로 삼아 에이전트의 요청과 토큰 사용량을 감시하고 보안 통제를 강화하겠다고 밝혔다.

보안 기업이 이 영역에 관심을 두는 이유는 분명하다. AI가 직접 도구를 호출하고 작업을 실행하면 권한과 데이터 접근, 비용을 함께 관리해야 한다. 요청이 지나는 관문은 이 통제를 적용할 수 있는 지점이다.

결제 기업 스트라이프는 8월 19일 오픈라우터 인수에 합의했다고 발표했다. 당시 회사 설명에 따르면 오픈라우터는 80곳이 넘는 공급사의 400개 이상 모델을 연결한다. 스트라이프는 요청의 성격과 가격, 속도, 신뢰성을 따져 모델을 선택하는 기술을 자사 AI 사업과 결합하겠다고 밝혔다. 공식 발표에는 거래 금액을 담지 않았다.

이 거래는 토큰 사용량 관리가 결제 사업과도 맞물린다는 점을 보여준다. 기업은 AI 서비스를 팔아 얻는 매출과 모델을 호출하며 쓰는 비용을 함께 따져야 한다. 어느 모델에 요청을 보내느냐가 서비스의 수익성을 바꿀 수 있다.

오픈소스부터 데이터 플랫폼까지…관제 기능만으로는 어렵다

경쟁 상대는 다른 스타트업에 그치지 않는다. 오픈소스 프로젝트 라이트LLM(LiteLLM)은 여러 모델을 오픈AI 호환 인터페이스로 연결하고 비용 추적, 요청 라우팅, 가드레일 기능을 제공한다. 기업용 유료 기능도 별도로 운영한다. 오픈소스를 직접 설치하더라도 모델 사용료와 운영 비용까지 없어지는 것은 아니다.

데이터 플랫폼 기업도 이 기능을 갖췄다. 데이터브릭스의 AI 게이트웨이 문서는 사용자·그룹별 분당 요청 수와 토큰 수 제한, 사용량 기록 기능을 설명한다. 분당 처리량 제한과 월간 예산 상한은 다른 기능이지만, 모델 이용 정책과 사용량을 플랫폼 안에서 관리한다는 방향은 같다.

김종민 엔지니어는 래블업이 라이트LLM을 기반으로 삼지 않고 자체 개발했다고 설명했다. 서비스에서 출발한 기업과 GPU 인프라를 운영해 온 기업은 같은 토큰 관제 문제도 다르게 본다는 점을 강조했다.

래블업의 계산은 GPU 클러스터 운영과 모델 서빙, 토큰 제어를 연결하는 데 있다. 사내에서 직접 돌리는 모델과 외부 상용 모델을 함께 써야 하는 기업을 겨냥한다. 모델을 연결하는 기능에 더해 실제 운영에서 무엇을 해결해 줄 수 있느냐가 경쟁의 관건이다.

래블업은 업스테이지가 주관하는 ‘독자 AI 파운데이션 모델’ 컨소시엄에서 학습 인프라를 운영해 왔다. 회사 발표에 따르면 1차수에는 엔비디아 B200 GPU 500장 이상, 2차수에는 H100과 B200을 합친 1000장 규모 클러스터를 운영했다. 3차수에는 1000장 이상으로 확대할 계획을 밝혔다.

‘모두의 AI’ 사업에서는 KT 컨소시엄 참여 기업에 이름을 올렸다. 다만 컨소시엄 참여와 이번 토큰 관제 기술의 실제 도입은 구분해야 한다. GPU 인프라 운영 경험을 새로운 제품의 고객 확보로 얼마나 연결하느냐가 남은 과제다.

테크수다의 시각

클라우드가 처음 퍼질 때를 떠올린다. 개발자는 신용카드 하나로 서버를 켰고, 월말 청구서를 받아 든 재무팀은 비용을 관리할 방법을 찾았다. 지금 AI에서도 비슷한 질문이 나온다. 누가 얼마나 쓰고 있으며, 그 지출을 누가 책임질 것인가.

래블업 부스에서 눈길을 끈 것도 이 대목이었다. 모델을 여러 개 연결하는 시연이지만 설명은 곧 사용량과 한도, 결제로 이어졌다. AI를 얼마나 잘 만드느냐에 이어, 기업 안에서 어떻게 운영하고 비용을 감당할지를 묻는 장면이었다.

주목할 것은 이 관문을 누가 쥐느냐다. 보안 회사는 권한과 데이터 보호를, 결제 회사는 과금과 수익성을, 데이터 플랫폼은 사용량과 운영 정책을 앞세운다. 서로 다른 출발점에서 같은 자리로 모인다.

기업 고객에게는 모델 선택권을 넓힐 기회다. 다만 싼 모델로 바꿀 수 있다는 것만으로 충분하지는 않다. 업무에 필요한 품질과 응답 속도를 유지하면서 비용을 줄일 수 있어야 한다.

래블업도 같은 시험대에 선다. GPU를 운영해 온 경험은 출발점이 될 수 있다. 그 경험이 기업의 AI 청구서를 얼마나 예측 가능하게 만들고, 운영 부담을 얼마나 줄이는지 고객 현장에서 보여줘야 한다. 토큰 관제 시장의 승부는 연결한 모델 수를 넘어 그 운영 결과에서 갈릴 것이다. 경쟁이 본격 시작된 영역이지만 상대해야 할 곳들은 점차 늘어날 수밖에 없다.

AI에 대한 활용이 비용 이슈로 본격화되고 있다. 예견된 상황이고 국내외 수많은 기업들이 이 시장에 뛰어들고 있다. 사용한 만큼 비용을 지불한다는 말은 관리하지 않으면 요금 폭탄으로 청구서가 돌아온다는 말이다. 클라우드 가 등장한 지 20여 년 고객들은 동일한 문제를 AI 영역에서도 마주치고 있다. 핀옵스의 영역은 가장 큰 핵심 이슈다.

레블업 AI 핀옵스, 이런 점이 궁금하셨나요?

Q1. 토큰 관제, 모델 앞단에서 무엇을 관리하나

애플리케이션과 AI 모델 사이에서 요청을 전달하고 사용량을 집계한다. 제품과 설정에 따라 모델별·앱별 한도를 적용하고 요청 경로를 바꿀 수 있다.

Q2. 에이전트를 쓰면 비용이 반드시 수십 배 늘어나나

그 배수를 모든 서비스에 적용할 수는 없다. 기사 속 표현은 래블업 관계자의 현장 설명이다. 실제 사용량은 작업과 모델 호출 방식에 따라 달라진다.

Q3. 래블업은 무엇을 시연했나

여러 모델을 한 라우터에 연결하고 모델별·앱별 토큰 사용량과 한도를 관리하는 기능을 보여줬다. 관계자는 국내 금융사 한 곳이 출시 전 버전을 도입했다고 설명했다.

Q4. 팔로알토와 스트라이프는 인수를 모두 마쳤나

팔로알토네트웍스는 포트키 인수를 마쳤다. 스트라이프가 8월 19일 발표한 것은 오픈라우터 인수 합의다. 인수 완료로 표현하지 않았다.

Q5. 토큰 관제를 도입하면 모델 사용료가 없어지나

외부 모델 사용료는 계속 발생한다. 관제 도구는 사용량을 추적하고 요청을 제한하거나 적절한 모델을 선택해 지출을 관리하는 수단이다.

[테크수다 기자 도안구 eyeball@techsuda.com]

Newsletter
디지털 시대, 새로운 정보를 받아보세요!

테크가 전 산업 영역에 스며드는 소식에 관심이 많다. 1999년 정보시대 PCWEEK 테크 전문지 기자로 입문한 후 월간 텔레닷컴, 인터넷 미디어 블로터닷넷 창간 멤버로 활동했다. 개발자 잡지 마이크로소프트웨어 편집장을 거쳐 테크수다를 창간해 지금까지 활동하고 있다. 태블릿을 가지고 얼굴이 꽉 찬 방송, 스마트폰을 활용한 현장 라이브를 한국 최초로 진행했다.