HPC(High Performance Computing) 환경에서 3.7PB 스토리지 서버 구축 사례

HPC(High Performance Computing) 환경에서
스토리지는 단순한 데이터 저장소 그 이상의 의미를 갖습니다.
연산 서버가 처리할 데이터를 공급하고, 계산 과정에서 생성되는 결과를 다시 저장해야 하기 때문에
스토리지의 처리 성능과 네트워크 구조가 전체 연산 환경의 효율에 영향을 줄 수 있습니다.
특히 데이터 규모가 수백 TB를 넘어 PB(페타바이트) 단위로 증가하면
데이터의 크기와 접근 방식, 서버와 스토리지 사이의 네트워크,
확장 스토리지 연결 구조까지 모두 감안하여 하나의 인프라로 설계해야 합니다.
창리정보통신이 구축한 3.744PB RAW 용량의 스토리지 서버 구축 사례를 바탕으로
HPC와 연구·분석 환경에서 확인해야 할 설계 기준을 살펴보겠습니다.
HPC 환경, 병목 없는 설계가 중요합니다

HPC는 대규모 계산, 시뮬레이션, 과학·연구 데이터 분석 등
많은 데이터를 빠르게 처리해야 하는 환경에 사용됩니다.
이러한 시스템에서는 CPU와 GPU가 전체 처리 성능을 좌우할 것 같지만
사실 그렇지 만은 않습니다.
연산에 필요한 데이터를 스토리지에서 가져와야 하고,
재가공 된 데이터는 다시 저장해야 하기 때문입니다.
높은 성능의 연산 서버를 사용하더라도
스토리지 구간에서 데이터 공급이 지연되면 해당 구간에 병목이 발생합니다.
따라서 HPC 인프라는 다음 세 영역을 하나로 묶어 접근해야 합니다.
- Compute : CPU·GPU 등 실제 연산을 수행하는 영역
- Network : 서버와 스토리지 사이에서 데이터를 전달하는 영역
- Storage : 원본 데이터와 연산 결과를 저장하고 공급하는 영역
PB급 데이터를 다루는 환경에서는 어느 한쪽의 성능에 치우치기 보다
실제 데이터가 이동하는 모든 영역의 성능이 받쳐줘야
지연 없는 데이터 처리가 가능합니다.
대용량 스토리지 서버 구축의 3가지 기준

대용량 스토리지 구축시 따져봐야 할 대표적인 기준은
Throughput, IOPS, Latency입니다.
Throughput
Throughput은 일정 시간 동안 얼마나 많은 데이터를 전송할 수 있는지를 의미합니다.
대용량 영상, 위성 데이터, 연구 데이터처럼 큰 파일을 연속적으로 읽거나 기록하는 작업에서는 중요한 기준이 됩니다.
IOPS
IOPS(Input/Output Operations Per Second)는 초당 처리할 수 있는 읽기·쓰기 작업의 횟수입니다.
작은 파일을 다수 처리하거나 요청이 빈번하게 발생하는 업무에서는 IOPS의 영향이 커집니다.
Latency
Latency는 데이터를 요청한 시점부터 응답을 받기까지의 지연시간입니다.
요청과 응답이 반복되는 워크로드에서는 낮은 Latency가 중요합니다.
따라서 HPC 스토리지의 사양을 결정하기 전에 먼저
실제 데이터가 큰 파일 위주인지, 작은 파일이 많은지, 순차 읽기·쓰기가 많은지,
여러 서버가 동시에 접근하는지 등을 파악해야 합니다.
3.744PB 연구용 스토리지 구축



창리정보통신은 이처럼 명확한 기준 아래
기후·환경 데이터를 다루는 국내 연구기관에 3.744PB RAW 용량의 대용량 스토리지를 구축했습니다.
위성 관측 데이터와 센서 시계열 데이터 등 대규모 데이터를 장기간 저장하면서
기후 모델링과 분석 과정에서 생성되는 데이터까지 지속적으로 누적되는 환경이었습니다.
그래서 원활한 인프라 구축을 위해 다음 조건을 함께 고려했습니다.
- PB 단위 데이터 저장 공간
- 연구자와 분석 서버의 데이터 접근
- 대용량 데이터 전송을 위한 네트워크
- 향후 용량 확장
- 파일 및 블록 방식의 서로 다른 데이터 접근
- 다수의 디스크를 연결하는 확장 스토리지 구조
이를 기반으로 메인 스토리지와 대용량 확장 스토리지,
프론트엔드 네트워크와 스토리지 백엔드를 각각 나누어 구성했습니다.
QSAN XCubeNXT XN8112D로 구성한 메인 스토리지

메인 스토리지는 QSAN XCubeNXT XN8112D로 구성했습니다.
XN8112D는 두 컨트롤러가 동작하는 Dual-Active 구조의 엔터프라이즈 유니파이드 스토리지입니다.
이번 구축에서는 두 개의 컨트롤러당 128GB로 메모리를 확장하여,
총 256GB 메모리로 구성했습니다.




유니파이드 스토리지를 선택한 이유는
연구자와 분석 서버가 데이터를 사용하는 방식이 서로 달랐기 때문입니다.
연구자는 저장된 데이터를 일반적인 공유 폴더처럼 열어보고 관리해야 하는 반면,
분석 서버는 대용량 데이터를 처리하기 위해 스토리지를 서버에 직접 연결된 디스크처럼 사용하는 환경이 필요할 수 있습니다.
XN8112D는 하나의 스토리지에서 SMB·NFS와 같은 파일 방식과 iSCSI 기반의 블록 방식을 모두 구성할 수 있습니다.
따라서 연구자용 파일 저장 공간과 분석 서버용 블록 스토리지를 각각 별도의 장비로 구축하지 않고,
하나의 스토리지 시스템 안에서 용도에 맞게 나누어 운영할 수 있도록 설계했습니다.
156개의 24TB SAS HDD로 구성한 페타바이트 저장소




저장 공간은 QSAN XD5378D 확장 스토리지 2대를 이용해 구성했습니다.
78개의 드라이브 장착이 가능한 XD5378D 두 대를 연결해
총 156개의 드라이브 베이를 사용할 수 있습니다.
여기에 Western Digital Ultrastar DC HC590 24TB SAS HDD 156개를 장착해
전체 3.744PB 의 물리적 용량을 확보했습니다.

하지만 3.744PB를 모두 데이터 저장 공간으로 사용하는 것은 아닙니다.
156개의 대용량 HDD를 하나의 거대한 RAID 그룹으로 묶으면
특정 디스크에 장애가 발생했을 때 전체 데이터가 소실될 수 있습니다.
HDD 한두 개에 장애가 발생하더라도 데이터를 보호할 수 있도록
일부 용량을 데이터 보호에 사용하는 RAID60 방식을 적용했습니다.
RAID60은 156개의 HDD를 하나의 거대한 묶음으로 사용하는 대신
여러 개의 작은 그룹으로 나누어 데이터를 저장하고 보호하는 방식입니다.
이번 구축에서는 RAID60을 기준으로 6개의 RAID6 그룹으로 나누어 구성했습니다.
156개의 HDD를 6개 그룹으로 나누어 RAID6로 구성합니다.
그룹 별로 24개 분량은 실제 데이터를 저장하는 데 사용하고,
2개 분량은 HDD 장애가 발생했을 때 데이터를 복구하기 위한 보호 영역으로 사용합니다.
그래서 3.744PB의 전체 공간 중 약 288TB를 디스크 장애에 대비하기 위한 보호 영역으로 지정하고,
나머지 약 3.456PB를 데이터 저장할 수 있는 실사용 용량으로 구성하였습니다.

RAID60을 사용하는 이유는 데이터 보호뿐만이 아닙니다.
데이터를 여러 RAID 그룹에 분산해 읽고 쓸 수 있기 때문에
많은 디스크를 사용하는 PB급 스토리지에서 데이터 처리 성능을 확보하는데에도 도움이 됩니다.
프론트엔드와 스토리지 백엔드의 분리

이번 구성에서 중요한 설계 포인트 중 하나는 데이터가 이동하는 경로를 구분한 것입니다.
연구자와 분석 서버가 스토리지에 접근하는 프론트엔드 구간은 100GbE 네트워크 기반으로 구성하고,
XN8112D와 두 대의 XD5378D가 연결되는 스토리지 백엔드는 12Gb/s SAS Wide 기반으로 구성했습니다.

프론트엔드는 서버와 사용자가 실제 데이터를 요청하고 전달받는 구간,
백엔드는 메인 스토리지 컨트롤러와 다수의 드라이브가 장착된 확장 스토리지 사이에서 데이터가 이동하는 구간입니다.
두 영역은 담당하는 역할이 다르기 때문에 PB급 스토리지에서는 각각 필요한 대역폭과 연결 구조를 별도로 검토해야 합니다.
이처럼 HPC 환경은 단순히 페타바이트의 대용량 저장 공간을 확보하는 것에서 끝나지 않고,
저장된 데이터를 서버까지 어떤 경로로 효율적으로 전달할 것인지까지 함께 설계해야 합니다.
대용량 스토리지 구축의 핵심은 전문적인 설계

PB급 스토리지는 어느 정도의 속도로 요구하는지,
스토리지 내부에서 데이터를 어떻게 처리하는지,
네트워크가 그 데이터를 충분히 전달할 수 있는지까지 판단해야 합니다.
창리정보통신은 아래와 같은 기준에 맞춰
대용량 스토리지 구축에 필요한 상담부터 설계, 구축, 관리까지 도와드리고 있습니다.
- 현재 저장된 데이터와 향후 증가 예상량
- 데이터 보관 기간
- 대용량 파일과 소형 파일의 비중
- 순차 및 랜덤 읽기·쓰기 특성
- 필요한 Throughput과 IOPS
- 동시에 접근하는 사용자와 서버
- SMB·NFS·iSCSI 등 필요한 접근 방식
- 서버와 스토리지 사이의 네트워크 대역폭
- 메인 스토리지와 확장 장비의 연결 구조
- RAID와 데이터 보호 정책
- 향후 스토리지 확장 가능성
HPC나 AI 서버를 운영중이시라면 병목 없는 스토리지 설계가 중요합니다.
1988년 부터 이어진 업력으로 기술력과 서비스를 검증받은 창리정보통신으로 문의주세요.

문의가 정상적으로
접수되었습니다.
담당자가 확인 후
순차적으로 답변드릴 예정입니다.
빠른 시일 내에 회신드릴 수 있도록 노력하겠습니다. 감사합니다.