생성형 AI를 이야기할 때 가장 많이 언급되는 비용은 대규모 모델을 처음 만드는 학습 비용입니다. 수천 대 또는 수만 대의 GPU(Graphics Processing Unit·그래픽처리장치)를 동시에 사용해 몇 주에서 몇 달 동안 모델을 학습하기 때문에 막대한 비용이 들어갑니다.
하지만 AI 서비스를 실제로 운영하기 시작하면 또 다른 비용이 계속 발생합니다.
바로 Inference(인퍼런스·추론) 비용입니다.
Training(트레이닝·학습)은 AI 모델을 만드는 과정이고, Inference(인퍼런스·추론)는 학습이 끝난 모델을 실제 사용자가 사용하는 과정입니다.
사용자가 질문을 입력할 때마다 서버에서는 GPU(Graphics Processing Unit·그래픽처리장치)가 작동하고 AI 모델이 다음 Token(토큰·AI가 문장을 처리하는 기본 단위)을 계산합니다.
사용자가 수백만 명으로 늘어나면 이런 계산은 하루에도 엄청난 횟수로 반복됩니다.
그래서 AI 기업에서는 좋은 모델을 만드는 것뿐 아니라 같은 수준의 답변을 얼마나 적은 비용으로 만들어낼 수 있는지도 매우 중요합니다.
1. AI 추론은 무엇을 계산하는 과정인가
Inference(인퍼런스·추론)는 학습을 끝낸 AI 모델을 이용해 새로운 답변이나 결과를 만들어내는 과정입니다.
사용자가 질문을 입력하면 AI는 문장을 Token(토큰·AI가 처리하는 작은 언어 단위)으로 나눕니다.
각 Token(토큰)은 숫자 형태의 데이터로 바뀌고 여러 Neural Network Layer(뉴럴 네트워크 레이어·신경망 층)를 통과합니다.
언어 모델은 지금까지 입력된 내용을 바탕으로 다음에 등장할 Token(토큰)의 확률을 계산합니다.
예를 들어 다음에 들어갈 수 있는 단어 후보가 여러 개라면 각각의 가능성을 계산한 뒤 하나를 선택합니다.
그 Token(토큰)이 문장에 추가되면 다시 다음 Token(토큰)을 계산합니다.
이 과정이 수백 번 반복되면서 하나의 긴 답변이 완성됩니다.
사용자가 보는 화면에서는 글자가 자연스럽게 한 줄씩 나타나는 것처럼 보이지만 서버 내부에서는 Matrix Operation(매트릭스 오퍼레이션·행렬 연산)이 계속 반복되고 있습니다.
2. GPU 가격만으로 추론 비용을 계산할 수 없는 이유
AI 서버에서 가장 비싼 부품 가운데 하나는 GPU(Graphics Processing Unit·그래픽처리장치)입니다.
GPU는 원래 그래픽 계산을 위해 발전했지만 Parallel Computing(패럴렐 컴퓨팅·병렬 연산)에 매우 강하기 때문에 AI 학습과 추론에 널리 사용됩니다.
그렇다고 GPU 한 장의 가격만으로 AI 추론 비용을 계산할 수 있는 것은 아닙니다.
중요한 것은 GPU가 일정 시간 동안 실제로 얼마나 많은 Token(토큰)을 처리할 수 있는가입니다.
예를 들어 같은 가격의 GPU 서버 두 대가 있다고 가정해보겠습니다.
A 서버가 한 시간 동안 200만 Token(토큰)을 처리하고 B 서버가 같은 시간 동안 400만 Token(토큰)을 처리한다면 B 서버의 Token(토큰)당 비용이 훨씬 낮아질 수 있습니다.
따라서 실제 AI 데이터센터에서는 GPU를 얼마에 샀는지보다 그 GPU가 실제 서비스 환경에서 얼마나 많은 Token(토큰)을 처리할 수 있는지가 중요합니다.
3. Tokens per Second가 중요한 이유
Tokens per Second(토큰 퍼 세컨드·초당 토큰 처리량)는 AI 추론 서버의 중요한 성능 지표입니다.
쉽게 말하면 AI 서버가 1초 동안 몇 개의 Token(토큰)을 처리하거나 생성할 수 있는지를 보여줍니다.
예를 들어 어떤 서버가 초당 500개의 Token(토큰)을 생성한다고 가정해보겠습니다.
1시간은 3,600초이므로 단순 계산하면 상당히 많은 Token(토큰)을 처리할 수 있습니다.
추론 비용은 아주 단순하게 보면 다음과 같은 방식으로 생각할 수 있습니다.
서버 시간당 비용 ÷ 시간당 처리 가능한 Token 수 = Token당 서버 비용
예를 들어 서버 운영비가 시간당 20달러이고 한 시간 동안 200만 Token(토큰)을 처리한다면 GPU 서버비용만 기준으로 100만 Token(토큰)당 약 10달러가 됩니다.
GPU·전력·처리량을 함께 넣어 계산하면
조금 더 현실적인 구조를 이해하기 위한 가정 예시를 들어보겠습니다. GPU 서버의 시간당 비용을 20달러, 서버와 냉각을 포함한 전력 관련 비용을 시간당 0.5달러, 네트워크와 기타 운영비를 시간당 1.5달러라고 가정하면 총 운영비는 시간당 22달러입니다.
이 서버가 실제 서비스 환경에서 한 시간에 400만 Token을 처리한다면 단순 계산으로 100만 Token당 인프라 비용은 약 5.5달러가 됩니다. 계산식은 22달러 ÷ 400만 Token × 100만입니다.
만약 같은 서버에서 Batching과 캐싱, 양자화 등을 적용해 처리량을 시간당 800만 Token으로 높인다면 다른 비용 조건이 같다는 가정에서 100만 Token당 비용은 약 2.75달러로 내려갑니다.
이 숫자는 특정 기업의 실제 원가가 아니라 비용 구조를 설명하기 위한 가정입니다. 실제 추론비용에는 GPU 구매 또는 임대비, 감가상각, 전기요금, PUE, 냉각, CPU와 메모리, 네트워크, 소프트웨어, 가동률 등이 함께 영향을 줍니다.
하지만 실제 데이터센터에서는 CPU(Central Processing Unit·중앙처리장치), 메모리, 저장장치, 네트워크, 전력, 냉각장치 등의 비용도 함께 들어갑니다.
4. GPU Utilization이 비용을 바꾼다
GPU Utilization(GPU 유틸리제이션·GPU 사용률)은 AI 추론비용에 큰 영향을 줍니다.
비싼 GPU를 구입했더라도 계산하지 않고 기다리는 시간이 많다면 경제성이 떨어집니다.
예를 들어 GPU 서버를 하루 24시간 켜놓았지만 평균 사용률이 30%라면 상당한 자원이 활용되지 않는 셈입니다.
AI 기업들은 이를 줄이기 위해 Batching(배칭·여러 사용자의 요청을 묶어 동시에 처리하는 기술)을 사용합니다.
여러 사용자의 요청을 하나의 Batch(배치·작업 묶음)로 만들어 GPU가 동시에 처리하도록 하는 것입니다.
이렇게 하면 GPU 내부의 많은 연산장치를 더 효율적으로 사용할 수 있습니다.
같은 GPU에서 더 많은 Token(토큰)을 처리하게 되면 Token(토큰) 하나당 비용도 낮아질 수 있습니다.
따라서 AI 기업의 경쟁력은 GPU를 얼마나 많이 가지고 있느냐뿐 아니라 GPU를 얼마나 효율적으로 사용하느냐에도 달려 있습니다.
5. Throughput과 Latency가 중요한 이유
AI 추론에서는 Throughput(스루풋·일정 시간 동안 처리할 수 있는 전체 작업량)과 Latency(레이턴시·응답 지연시간)가 중요한 지표입니다.
Throughput(스루풋)이 높으면 같은 시간 동안 더 많은 사용자의 요청을 처리할 수 있습니다.
하지만 효율만 높이기 위해 너무 많은 요청을 한꺼번에 모으면 사용자가 기다리는 시간이 길어질 수 있습니다.
사용자가 질문한 뒤 첫 글자가 나타나는 데 걸리는 시간도 중요합니다.
이를 Time to First Token(타임 투 퍼스트 토큰·첫 번째 토큰이 출력될 때까지 걸리는 시간)이라고 합니다.
첫 번째 Token(토큰)이 빨리 나오면 사용자는 AI가 빠르게 반응한다고 느낍니다.
따라서 AI 서비스는 많은 Token(토큰)을 처리하는 것과 빠르게 답변을 시작하는 것 사이에서 균형을 맞춰야 합니다.
6. 모델 크기가 커지면 비용도 커질까
AI 모델은 수십억 개에서 수천억 개 이상의 Parameter(파라미터·AI가 학습한 가중치 값)를 가질 수 있습니다.
일반적으로 Parameter(파라미터)가 많아지면 더 많은 메모리와 계산량이 필요합니다.
하지만 전체 Parameter(파라미터) 숫자만 보고 실제 추론비용을 판단하면 정확하지 않을 수 있습니다.
Mixture of Experts(믹스처 오브 엑스퍼츠·전문가 혼합 구조) 모델에서는 전체 모델이 매우 크더라도 한 번의 Token(토큰) 계산에는 일부 Expert(엑스퍼트·전문 신경망)만 사용할 수 있습니다.
실제로 한 번의 추론에서 사용되는 Parameter를 Active Parameters(액티브 파라미터·실제 활성화되는 파라미터)라고 볼 수 있습니다.
또 Quantization(퀀타이제이션·양자화)을 사용하면 16비트 모델을 8비트나 4비트 수준으로 줄여 메모리 사용량과 연산량을 낮출 수 있습니다.
따라서 AI 추론 비용을 비교할 때는 전체 모델 크기뿐 아니라 실제 활성화되는 Parameter(파라미터)와 데이터 정밀도도 함께 살펴봐야 합니다.
7. HBM과 메모리 대역폭이 중요한 이유
AI 추론에서는 HBM(High Bandwidth Memory·고대역폭 메모리)도 매우 중요합니다.
AI 모델이 Token(토큰)을 생성할 때 GPU는 모델의 Parameter(파라미터) 데이터를 계속 읽어야 합니다.
이 데이터를 얼마나 빠르게 GPU 연산장치로 전달할 수 있는지를 Memory Bandwidth(메모리 밴드위스·메모리 대역폭)라고 합니다.
GPU 계산장치가 아무리 빠르더라도 필요한 데이터가 늦게 도착하면 GPU는 계산하지 못하고 기다리게 됩니다.
이런 현상을 Memory Bottleneck(메모리 보틀넥·메모리 병목현상)이라고 합니다.
특히 AI가 답변을 Token(토큰) 하나씩 생성하는 Decode(디코드·출력 토큰 생성) 단계에서는 메모리 대역폭이 전체 성능을 제한하는 경우도 있습니다.
그래서 AI 반도체 경쟁에서는 GPU의 계산 능력과 함께 HBM(고대역폭 메모리)의 용량과 속도도 매우 중요합니다.
8. Context와 KV Cache도 비용을 만든다
사용자의 질문이나 문서가 길어지면 Context(컨텍스트·AI가 한 번에 참고하는 전체 정보)도 커집니다.
AI가 긴 Context(컨텍스트)를 처리하려면 더 많은 Input Token(인풋 토큰·입력 토큰)을 읽어야 합니다.
또 AI는 이전 Token(토큰)에서 계산한 결과를 KV Cache(Key-Value Cache·키와 값 계산 결과를 저장하는 임시 메모리)에 보관합니다.
KV Cache(키·값 캐시)를 사용하면 이미 계산한 내용을 다음 Token(토큰)을 생성할 때 다시 처음부터 계산하지 않아도 됩니다.
하지만 Context(컨텍스트)가 길어지면 KV Cache(키·값 캐시)도 함께 커집니다.
한 명의 사용자가 긴 문서를 처리하는 것과 수천 명의 사용자가 동시에 긴 문서를 처리하는 것은 완전히 다른 문제입니다.
KV Cache(키·값 캐시)가 GPU 메모리를 많이 사용하면 GPU 한 장에서 동시에 처리할 수 있는 사용자 수가 줄어들 수 있습니다.
결과적으로 더 많은 GPU가 필요해지고 비용도 증가할 수 있습니다.
9. 전력과 냉각도 추론 비용에 들어간다
AI 데이터센터에서는 GPU뿐 아니라 다양한 장비가 전력을 소비합니다.
CPU(Central Processing Unit·중앙처리장치), HBM(High Bandwidth Memory·고대역폭 메모리), SSD(Solid State Drive·고속 저장장치), Network Switch(네트워크 스위치·서버 사이의 데이터를 전달하는 장비) 등이 모두 전기를 사용합니다.
고성능 AI 서버가 밀집되면 많은 열이 발생합니다.
이를 식히기 위해 Air Cooling(에어 쿨링·공랭식 냉각)이나 Direct Liquid Cooling(다이렉트 리퀴드 쿨링·직접 액체냉각) 같은 기술이 사용됩니다.
GPU가 사용하는 전력 외에도 냉각, 펌프, 전력변환 장치 등에 추가적인 전력이 필요합니다.
따라서 같은 GPU 서버를 사용하더라도 지역별 전기요금과 데이터센터 효율에 따라 실제 추론비용이 달라질 수 있습니다.
전력이 풍부하고 안정적으로 공급되는 지역이 AI 데이터센터 입지로 중요해지는 이유도 여기에 있습니다.
10. 결국 핵심은 Cost per Token이다
AI 서비스의 경제성을 판단할 때 중요한 개념 가운데 하나가 Cost per Token(코스트 퍼 토큰·토큰 하나를 처리하는 비용)입니다.
같은 품질의 답변을 제공한다면 100만 Token(토큰)을 더 적은 비용으로 처리할 수 있는 기업이 유리합니다.
이를 위해 AI 기업은 여러 최적화 기술을 사용합니다.
Quantization(퀀타이제이션·양자화)을 이용해 모델의 메모리 사용량을 줄일 수 있습니다.
Prompt Caching(프롬프트 캐싱·반복되는 입력 내용을 저장해 다시 사용하는 기술)을 이용하면 같은 내용을 반복 계산하는 비용을 줄일 수 있습니다.
Speculative Decoding(스페큘러티브 디코딩·작은 모델이 후보 토큰을 먼저 만들고 큰 모델이 검증하는 추측 디코딩)을 이용해 답변 생성속도를 높일 수도 있습니다.
Model Routing(모델 라우팅·질문의 난이도에 따라 적절한 AI 모델을 선택하는 방식)을 사용해 간단한 질문은 작은 모델로 처리하고 복잡한 문제만 큰 모델에 전달할 수도 있습니다.
결국 AI 추론비용은 GPU 가격 하나로 결정되지 않습니다.
GPU, HBM(고대역폭 메모리), Token(토큰), Context(컨텍스트), KV Cache(키·값 캐시), 네트워크, 전력, 냉각, GPU 사용률, 모델 구조와 소프트웨어 최적화가 모두 합쳐져 최종 비용이 결정됩니다.
앞으로 AI 산업에서는 누가 가장 큰 모델을 만들었는지만큼 같은 품질의 Token(토큰)을 누가 더 낮은 비용으로 생산할 수 있는지가 중요한 경쟁력이 될 수 있습니다.
AI 모델 경쟁은 결국 AI Token(토큰)의 생산비를 낮추는 경쟁으로 이어지고 있습니다.