AI 데이터센터에서 SSD가 중요한 이유, GPU만으로는 안 되는 이유

AI 데이터센터 이야기가 나오면 대부분 GPU부터 떠올립니다.

실제로 AI 학습과 추론에서 GPU가 핵심인 것은 맞습니다. HBM도 중요하고, CPU와 DDR 메모리도 빠질 수 없습니다.

그런데 AI 서버 구조를 조금만 더 들여다보면 의외로 SSD의 역할도 상당히 큽니다.

처음에는 SSD가 단순히 데이터를 저장하는 장치라고 생각하기 쉽습니다. 일반 PC에서도 사진이나 문서, 프로그램을 저장하는 데 쓰이기 때문입니다.

하지만 AI 데이터센터에서는 SSD가 단순한 창고 역할만 하는 것은 아닙니다.

AI 학습 데이터를 읽어오고, 모델 파일을 불러오고, 학습 중간 결과를 저장하고, RAG용 문서와 벡터 데이터를 보관하는 데 계속 사용됩니다.

GPU가 아무리 빨라도 필요한 데이터가 제때 들어오지 않으면 기다릴 수밖에 없습니다.

결국 AI 서버에서 SSD는 계산을 직접 하지는 않지만 계산이 멈추지 않도록 데이터를 공급하는 역할을 합니다.

1. GPU가 빠르다고 전체 서버가 빠른 것은 아니다

AI 서버를 공장으로 생각하면 이해하기 쉽습니다.

GPU는 아주 빠른 생산설비입니다.

HBM은 생산설비 바로 옆에 있는 작업대이고, DDR은 그보다 넓은 작업공간이라고 볼 수 있습니다.

SSD는 작업에 필요한 재료를 보관하는 창고에 가깝습니다.

생산설비가 아무리 좋아도 창고에서 재료가 늦게 나오면 공장은 멈춥니다.

AI 서버도 비슷합니다.

GPU가 계산을 끝냈는데 다음 데이터를 아직 불러오지 못했다면 GPU는 기다리게 됩니다.

비싼 GPU가 아무 일도 하지 않고 대기하는 시간이 길어질수록 서버 효율은 떨어집니다.

그래서 AI 서버에서는 GPU 성능만큼 데이터 공급 속도도 중요합니다.

2. AI 학습에서는 엄청난 양의 데이터를 읽는다

AI Training(학습)은 데이터를 한 번 읽고 끝나는 작업이 아닙니다.

같은 데이터를 반복해서 읽으면서 모델의 가중치를 계속 조정합니다.

이미지 AI라면 수많은 사진과 영상 파일을 불러와야 하고, 언어 모델이라면 방대한 텍스트 데이터를 처리해야 합니다.

이 데이터를 전부 HBM이나 DDR에 올려놓을 수는 없습니다.

메모리는 빠르지만 비싸고 용량에도 한계가 있기 때문입니다.

그래서 대량의 학습 데이터는 SSD나 별도의 스토리지에 저장해두고 필요한 만큼 불러오는 방식으로 사용합니다.

여기서 저장장치가 느리면 결국 GPU도 영향을 받게 됩니다.

3. HDD보다 SSD가 유리한 이유

대용량 데이터를 보관하는 것만 생각하면 HDD도 충분히 사용할 수 있습니다.

HDD는 가격 대비 용량이 크다는 장점이 있습니다.

하지만 AI 작업에서는 단순히 파일 하나를 순서대로 읽는 경우만 있는 것이 아닙니다.

수많은 이미지 파일이나 작은 데이터 조각을 빠르게 불러와야 할 때가 많습니다.

이런 Random Access(임의 접근) 작업에서는 기계식으로 움직이는 HDD보다 SSD가 유리합니다.

특히 NVMe SSD는 여러 요청을 동시에 처리하는 능력이 좋아 AI 서버에서 자주 사용됩니다.

4. NVMe SSD가 중요한 이유

NVMe(Non-Volatile Memory Express, 비휘발성 메모리 고속 인터페이스)는 플래시 메모리를 빠르게 활용하기 위한 규격입니다.

일반 SATA SSD보다 훨씬 높은 전송속도와 많은 동시 입출력을 처리할 수 있습니다.

AI 학습에서는 한 개의 파일만 읽는 것이 아니라 여러 데이터가 동시에 들어오는 경우가 많습니다.

그래서 단순히 최대 읽기속도가 빠른 것보다 얼마나 많은 요청을 동시에 처리할 수 있는지가 더 중요할 때도 있습니다.

이때 IOPS(Input/Output Operations Per Second, 초당 입출력 처리 횟수) 같은 수치가 중요해집니다.

5. 실제 데이터는 SSD에서 바로 GPU로 가지 않는다

AI 서버 안에서는 데이터가 여러 단계를 거쳐 이동합니다.

보통 데이터를 SSD에서 읽은 뒤 CPU와 DDR 메모리에서 먼저 처리합니다.

이미지 파일이라면 압축을 풀고 크기를 조정할 수 있습니다.

텍스트라면 Tokenization(토큰화)을 거칩니다.

그다음 GPU가 처리할 수 있는 형태로 만들어 HBM으로 전달합니다.

즉 데이터 흐름을 단순하게 보면

SSD → DDR → GPU HBM

순서로 움직입니다.

이 가운데 SSD 단계에서부터 속도가 늦어지면 뒤쪽 장비가 아무리 좋아도 기다릴 수밖에 없습니다.

6. AI 학습에서는 체크포인트 저장도 중요하다

대형 AI 모델은 학습시간이 매우 깁니다.

몇 시간 만에 끝나는 것이 아니라 며칠 이상 이어지는 경우도 있습니다.

이런 작업을 하면서 중간중간 모델 상태를 저장합니다.

이를 Checkpoint(체크포인트)라고 합니다.

예를 들어 학습을 3일 동안 진행했는데 서버 문제가 발생했다고 해보겠습니다.

체크포인트가 없다면 처음부터 다시 시작해야 할 수도 있습니다.

하지만 일정 간격으로 학습 상태를 저장해두면 마지막 저장 지점부터 다시 시작할 수 있습니다.

모델 규모가 커질수록 체크포인트 파일도 커집니다.

그래서 저장 속도가 느리면 체크포인트 자체가 학습 흐름을 방해할 수도 있습니다.

7. 추론 서버에서도 SSD는 계속 필요하다

AI Inference(추론)에서는 학습보다 SSD 사용량이 적어 보일 수 있습니다.

하지만 모델을 서비스하려면 먼저 모델 파일을 저장장치에서 읽어와야 합니다.

AI 모델이 수십 GB 이상이라면 서버가 시작될 때 로딩시간도 무시하기 어렵습니다.

서비스 장애로 서버를 다시 시작하거나 GPU 서버를 새로 추가할 때도 모델을 빠르게 불러오는 능력이 중요합니다.

결국 SSD 속도는 단순한 저장 성능이 아니라 서비스 복구와 확장 속도에도 영향을 줄 수 있습니다.

8. AI 모델도 결국 저장해야 하는 파일이다

AI 모델이라고 하면 굉장히 복잡한 기술처럼 보이지만 저장할 때는 결국 파일 형태입니다.

모델 Weight(가중치), 설정 파일, Tokenizer(토크나이저), 체크포인트 같은 정보가 저장장치에 들어갑니다.

모델이 커질수록 저장해야 할 파일도 커집니다.

그래서 앞으로 AI 모델 규모가 계속 커진다면 저장장치에서 모델을 얼마나 빠르게 읽고 쓸 수 있는지도 더 중요해질 수 있습니다.

9. RAG와 벡터 데이터베이스에서도 SSD를 사용한다

RAG(Retrieval-Augmented Generation, 검색 증강 생성)는 AI가 외부 문서를 찾아 답변에 활용하는 방식입니다.

기업에서 RAG를 사용한다면 PDF, 보고서, 제품 매뉴얼, 상담기록 같은 자료를 저장해야 합니다.

이 문서를 Embedding(임베딩)으로 바꿔 Vector Database(벡터 데이터베이스)에 넣는 경우도 많습니다.

데이터 규모가 작다면 대부분 메모리에 올려둘 수 있습니다.

하지만 문서가 수백만 건으로 늘어나면 모든 데이터를 항상 RAM에 두기는 어렵습니다.

결국 SSD에 저장된 데이터를 필요할 때 읽어오는 구조가 필요해집니다.

이런 이유로 SSD는 생성형 AI 서비스에서도 계속 중요합니다.

10. 용량만 크다고 좋은 SSD는 아니다

AI 서버용 SSD를 볼 때 용량부터 확인하기 쉽습니다.

하지만 실제로는 몇 가지를 같이 봐야 합니다.

읽기·쓰기 속도뿐 아니라 IOPS, Latency(지연시간), Endurance(내구성)도 중요합니다.

특히 체크포인트와 로그 데이터를 자주 저장하는 서버에서는 쓰기 작업이 많을 수 있습니다.

SSD는 데이터를 무한정 쓰고 지울 수 있는 장치가 아닙니다.

NAND Flash(NAND 플래시)는 반복해서 쓰면 조금씩 마모됩니다.

그래서 데이터센터용 SSD는 일반 PC용 SSD보다 내구성과 안정성이 더 중요하게 평가됩니다.

11. 모든 데이터를 가장 빠른 SSD에 저장할 필요는 없다

AI 데이터센터는 저장해야 할 데이터가 워낙 많습니다.

그렇다고 모든 데이터를 가장 비싼 NVMe SSD에 넣는 것도 비효율적입니다.

지금 학습에 사용하는 데이터는 빠르게 접근해야 합니다.

반면 오래된 데이터나 백업 파일은 그렇게 빠를 필요가 없습니다.

그래서 실제 데이터센터에서는 저장장치도 계층화해서 사용하는 경우가 많습니다.

자주 사용하는 데이터는 빠른 SSD에 두고, 사용 빈도가 낮은 데이터는 상대적으로 저렴한 저장장치로 이동시키는 방식입니다.

속도와 비용을 함께 맞추는 것입니다.

12. 로컬 SSD와 중앙 스토리지를 함께 쓰는 이유

대규모 AI 데이터센터에서는 모든 데이터를 개별 GPU 서버에 저장하지 않습니다.

공통 데이터는 중앙 스토리지나 Object Storage(객체 저장소)에 두고 여러 서버가 함께 사용할 수 있습니다.

하지만 중앙 스토리지에 매번 접근하면 네트워크 부담이 커질 수 있습니다.

그래서 실제 학습에 자주 사용하는 데이터 일부를 GPU 서버 가까이에 있는 로컬 NVMe SSD에 복사해 Cache(캐시)처럼 사용하는 방법도 있습니다.

한 번 가져온 데이터를 가까운 곳에 두고 반복해서 사용하는 것입니다.

이렇게 하면 중앙 스토리지와 네트워크 부담을 줄이는 데 도움이 됩니다.

13. SSD가 빨라도 네트워크가 느리면 소용없다

여기에서 또 하나 중요한 부분이 나옵니다.

SSD만 빠르면 되는 것이 아닙니다.

중앙 스토리지에 있는 데이터를 GPU 서버로 보내려면 네트워크를 통과해야 합니다.

저장장치가 초당 많은 데이터를 읽을 수 있어도 네트워크 속도가 따라가지 못하면 결국 병목이 생깁니다.

그래서 AI 데이터센터를 볼 때는 저장장치와 네트워크를 따로 보기 어렵습니다.

GPU가 빨라질수록 저장장치와 네트워크도 함께 빨라져야 합니다.

14. GPU를 더 넣는다고 성능이 그대로 늘어나지 않는 이유

이 부분은 AI 데이터센터를 이해할 때 꽤 중요합니다.

GPU가 8개인 서버보다 16개인 서버가 무조건 두 배 빠를 것 같지만 실제로는 그렇지 않을 수 있습니다.

기존 저장장치와 네트워크가 GPU 8개에 데이터를 공급하기에도 빠듯했다면 GPU만 16개로 늘려도 데이터를 충분히 공급하지 못할 수 있습니다.

결국 새로 추가한 GPU까지 기다리는 시간이 생깁니다.

AI 서버는 GPU 개수만 늘린다고 성능이 그대로 따라 올라가는 구조가 아닙니다.

주변 시스템도 그만큼 같이 커져야 합니다.

15. AI 데이터센터의 핵심은 결국 데이터 이동이다

AI 서버를 계속 살펴보면 한 가지 공통점이 보입니다.

계산도 중요하지만 데이터를 어디서 어디로 얼마나 빨리 옮길 수 있느냐가 매우 중요합니다.

SSD에서 DDR로 데이터가 올라옵니다.

DDR에서 GPU의 HBM으로 이동합니다.

여러 GPU끼리도 데이터를 주고받습니다.

다른 서버와도 네트워크를 통해 데이터를 교환합니다.

GPU 성능이 계속 올라갈수록 이런 데이터 이동 속도도 함께 올라가야 합니다.

그렇지 않으면 비싼 GPU의 계산 능력을 제대로 활용하기 어렵습니다.

16. SSD를 정리해보면

SSD(Solid State Drive, 솔리드 스테이트 드라이브)는 AI 데이터센터에서 단순히 파일을 저장하는 부품이 아닙니다.

학습 데이터를 읽어오고, 모델 파일을 불러오고, 체크포인트를 저장하고, RAG 문서와 벡터 데이터를 보관하는 역할을 합니다.

특히 AI 모델과 데이터 규모가 커질수록 저장장치에서 읽고 써야 하는 데이터도 늘어납니다.

그래서 AI 서버에서는 GPU뿐 아니라 SSD 성능도 함께 봐야 합니다.

제가 보기에는 AI 데이터센터를 이해할 때 “어떤 GPU를 몇 개 사용했는가”만 보는 것보다 “데이터가 어디에서 시작해서 어떤 경로로 GPU까지 이동하는가”를 보는 것이 더 중요합니다.

GPU 바로 옆에서는 HBM이 데이터를 공급합니다.

CPU 쪽에서는 DDR이 작업공간 역할을 합니다.

그보다 아래에서는 SSD가 대용량 데이터를 보관하고 필요할 때 위쪽으로 올려보냅니다.

그리고 이 데이터를 서버 사이에서 옮길 때는 네트워크가 필요합니다.

결국 AI 데이터센터는 GPU 하나로 움직이는 시스템이 아닙니다.

GPU, HBM, DDR, SSD, 네트워크가 하나의 흐름으로 연결되어야 합니다.

그중 한 부분이라도 느려지면 가장 비싼 GPU가 기다리는 상황이 생길 수 있습니다.

그래서 SSD는 눈에 잘 띄지 않지만 AI 서버가 계속 일을 할 수 있도록 데이터를 받쳐주는 중요한 기반 장치라고 보는 것이 더 정확합니다.