2026년 기준, 메타가 값비싼 AI GPU의 유휴 시간을 줄이고 연구 속도를 높이기 위해 스토리지 시스템을 전면 재설계했습니다. SSD 캐싱과 통합 아키텍처로 데이터 로딩 시간을 획기적으로 단축하며 AI 인프라의 새로운 기준을 제시합니다.
AI 시대, 스토리지 병목 현상의 심각성
2026년 현재, 인공지능 기술은 전례 없는 속도로 발전하고 있으며, 이를 뒷받침하는 AI 가속기, 특히 GPU의 중요성은 더욱 커지고 있습니다. 하지만 메타의 사례는 값비싼 AI GPU가 데이터 지연으로 인해 반복적으로 멈춰 서는 문제가 여전히 심각하다는 것을 보여줍니다.
스토리지 시스템이 AI 컴퓨팅 파워의 발전을 따라가지 못하면서, GPU는 효율적으로 워크로드를 처리하지 못하고 대기 상태에 놓이게 됩니다. 메타의 엔지니어들에 따르면, 스토리지 병목 현상은 GPU 지연의 주요 원인으로 남아있으며, 이는 운영 비용을 증가시키고 연구 진행 속도를 늦추며, 개발 일정을 연장시키는 결과를 초래합니다.
메타는 이러한 지연 문제를 해결하기 위해 스토리지 아키텍처를 전면 재설계하여, 데이터 이동 속도 향상을 통해 값비싼 AI 하드웨어 투자로부터 더 큰 가치를 창출하고 있습니다.
테크토닉 아키텍처의 한계와 BLOB 스토리지로의 전환
메타의 엔지니어들은 페이스북, 인스타그램, 리얼리티 랩스, 메타 AI, 광고 시스템, 데이터베이스, 내부 데이터 웨어하우스 등 수많은 서비스를 지원하는 수백 엑사바이트 규모의 스토리지 클러스터를 운영하고 있습니다. 이 모든 핵심 서비스는 객체 스토리지, 파일 시스템, 블록 장치, 그리고 HDD와 SSD 전반에 걸친 데이터 배치를 관리하는 기본 스토리지 계층인 테크토닉(Tectonic)에 의존합니다.
그러나 최근 대규모 AI 데이터셋의 폭발적인 증가로 인해, 훨씬 더 높은 성능과 통합된 접근 방식을 요구하면서 메타는 전통적인 파일 스토리지에서 BLOB 스토리지(Binary Large Object)로 점차 전환해왔습니다. 기존에는 GPU 서버가 스토리지에서 정보를 요청할 때 여러 계층에 걸친 반복적인 메타데이터 조회 과정이 높은 지연 시간을 유발하여 AI 학습 파이프라인을 방해하는 고질적인 문제였습니다.
통합 메타데이터 서브시스템과 직접 스트리밍 혁신
메타는 이러한 고질적인 메타데이터 지연 문제를 해결하기 위해 메타데이터 서브시스템을 통합 스키마로 완전히 재구축했습니다. 이 혁신의 핵심은 ZippyDB를 기반으로 하며, 클라이언트가 스토리지 서버에서 데이터를 직접 검색할 수 있도록 구조를 변경한 것입니다.
이전에는 모든 데이터 전송이 애플리케이션 서버를 통해 라우팅되었지만, 재설계된 소프트웨어는 임베디드 클라이언트를 사용하여 테크토닉 스토리지 계층에서 정보를 직접 스트리밍할 수 있게 되었습니다. 이 방식은 불필요한 중간 단계를 제거하여 데이터 전송 대기 시간을 크게 줄였고, AI 워크로드의 효율성을 극대화했습니다. 2026년 AI 인프라의 핵심은 이러한 최적화된 직접적인 데이터 흐름에 있습니다.
지역별 BLOB 스토리지와 분산 캐싱 시스템 도입
분산형 AI 배포 환경을 효과적으로 지원하기 위해 메타는 GPU 클러스터 바로 옆에 지역별 BLOB 스토리지 시스템을 전략적으로 배치했습니다. 이는 거리가 먼 인프라 간의 정보 전송과 관련된 지연을 현저히 줄이는 매우 중요한 효과를 가져왔습니다.
또한, 유휴 GPU 호스트 메모리를 적극 활용한 분산 캐싱 시스템을 도입하여 평균 80%에 달하는 높은 캐시 적중률을 달성했습니다. 이 혁신적인 접근 방식 덕분에 메타데이터는 이제 1~2밀리초 이내에 접근 가능하게 되었습니다. 엔지니어들은 추가적으로 헤지드 리드(hedged reads)와 동적 동시성 제어(dynamic concurrency controls)를 적용하여, “새로운 BLOB 스토리지 스택이 이제 GPU 지연 없이 AI 워크로드를 처리할 수 있게 되었다”고 강조합니다.
SSD 캐싱으로 AI 데이터 로딩 시간 획기적 단축
AI 학습이 시작되기 전, 연구자들이 엄청난 데이터셋 스냅샷을 BLOB 스토리지에서 지역 GPU 시설로 전송할 때 발생하던 몇 시간 단위의 길고 지루한 지연은 메타에게 큰 고민이었습니다. 메타는 이 문제를 해결하기 위해 여러 계층의 캐시를 구축했습니다.
이제 자주 사용되는 데이터는 GPU 서버에 훨씬 더 가까이 유지됩니다. 이 다단계 캐싱 전략은 GPU 메모리를 L1 캐시로 활용하고, GPU 호스트 내 SSD를 L2 캐시로, 그리고 지역별 플래시 기반 BLOB 스토리지를 L3 캐시로 활용합니다. 전통적인 HDD 스토리지는 여전히 원본 데이터 소스 역할을 하지만, 처리 중 느린 디스크가 필요하기 전에 빠른 캐시 계층이 빈번하게 요청되는 정보를 제공합니다.
데이터 수집 속도의 놀라운 도약과 생산성 향상
메타의 스토리지 재설계는 데이터 수집 속도에서 엄청난 향상을 가져왔습니다. 이전에는 약 150분(2시간 30분)이나 걸리던 데이터 로딩 과정이 이제는 단 10분으로 극적으로 단축되었습니다. 더욱 놀라운 점은, 한때 완료하는 데 무려 89시간이 필요했던 별도의 작업이 이제는 시작부터 완료까지 단 3시간 조금 넘게 걸린다는 사실입니다.
이러한 속도 개선은 AI 연구의 속도를 비약적으로 높여줍니다. 개발자들은 훨씬 더 빠르게 반복 작업을 수행하고, 새로운 모델을 테스트하며, 혁신적인 솔루션을 만들 수 있게 되었습니다. 2026년 현재, 이러한 데이터 처리 속도의 도약은 AI 개발의 판도를 바꾸는 중요한 이정표가 됩니다.
스토리지 비용 효율성에 대한 새로운 경제적 관점
시트리니(Citrini) 분석가 주칸(Jukan)은 과거 고용량 스토리지가 주로 테라바이트당 비용으로만 평가되었음을 지적합니다. 그러나 그는 데이터가 너무 느리게 도착하여 값비싼 GPU가 매일 유휴 상태로 머무는 시간이 발생한다면, 저렴한 스토리지에서 얻는 모든 비용 절감 효과를 훨씬 상회할 수 있다고 주장합니다.
이는 유휴 GPU 시간 비용이 플래시 스토리지 자체의 시간당 비용보다 클 때, 플래시 스토리지의 투자가 경제적으로 훨씬 더 합리적이라는 것을 시사합니다. 메타의 이번 투자는 단순히 성능 향상을 넘어, AI 시대의 스토리지 투자에 대한 경제적 사고방식 자체를 변화시키고 있습니다. 효율적인 AI 인프라 구축은 이제 속도와 비용의 복합적인 고려를 요구하는 시대입니다.
2026년, AI 개발의 새로운 지평을 열다
메타의 이번 스토리지 시스템 재구축은 2026년 AI 개발의 새로운 기준을 명확히 제시합니다. 값비싼 AI GPU의 효율성을 극대화하고, 데이터 지연으로 인한 연구 병목 현상을 해소함으로써, 메타는 AI 연구 및 개발 속도를 획기적으로 향상시켰습니다.
통합된 메타데이터 아키텍처, 효율적인 직접 스트리밍, GPU 인접 지역별 BLOB 스토리지, 그리고 다단계 SSD 캐싱 전략은 데이터 로딩 시간을 불과 몇 시간에서 몇 분으로 단축시키는 놀라운 성과를 이루어냈습니다. 이는 AI 인프라가 단순히 데이터를 저장하는 것을 넘어, 데이터를 얼마나 빠르고 효율적으로 전달하는지가 핵심 가치임을 다시 한번 증명합니다. 앞으로 다른 거대 기술 기업들도 메타의 사례를 벤치마킹하며 AI 스토리지 전략을 재정비할 것으로 예상됩니다.

