파일 전송
AI Infrastructure는 그대로 두고 Storage와 Compute 사이 데이터 이동만 담당하는 INNORIX AI Data Delivery를 소개합니다.
AI DATA DELIVERY
AI 인프라에는 이미 각자의 역할을 수행하는 전문 시스템이 있습니다. Kubernetes와 GPU Scheduler는 Compute Resource를 배치하고, Kubeflow와 같은 ML Orchestrator는 Pipeline의 실행 순서·조건·Artifact 흐름을 관리합니다.
INNORIX AI Data Delivery는 이 영역을 대체하지 않습니다.
INNORIX가 담당하는 것은 Dataset, Model, Checkpoint와 Result의 실제 파일을 Storage와 Compute 사이에서 이동시키는 Data Delivery Layer입니다.
Object Storage · Data Center · File Storage · Research Data
AI Data Delivery
GPU / AI Compute
Checkpoint / Result
ROLE SPLIT
AI Pipeline의 각 시스템은 서로 다른 문제를 해결합니다. Compute를 어디에 배치할 것인지, 어떤 Job을 먼저 실행할 것인지, Training과 Evaluation을 어떤 순서로 실행할 것인지는 기존 Orchestrator와 Scheduler의 영역입니다.
AI Data Delivery는 그 결정에 따라 실제 데이터가 목적지까지 전달되는 과정을 담당합니다.
Kubeflow도 Pipeline Artifact를 Dataset, Model 등의 논리적 객체와 URI로 관리하고, Pipeline Root나 Workspace를 통해 Artifact Storage를 연결합니다. 이는 ML Orchestration과 Artifact Management의 영역이며, INNORIX는 그 위나 아래에서 경쟁하는 대신 서로 다른 Storage와 Compute 사이에서 실제 대규모 데이터를 전달하는 역할에 집중합니다.
DATA PATH
AI Compute가 준비되어 있다는 것과 필요한 Dataset이 그 Compute에 준비되어 있다는 것은 같은 문제가 아닙니다.
Dataset은 Object Storage에 있고 Training은 On-Prem GPU Cluster에서 실행될 수 있습니다. 반대로 기업 내부 Storage의 Dataset을 Cloud GPU로 전달하거나, Training 결과를 다시 다른 Region이나 Private Storage로 회수해야 할 수도 있습니다. AI Data Delivery는 이 구간을 하나의 Transfer Layer로 연결합니다.
Object Storage · Data Center
Compute와 Storage가 같은 환경에 있어야 한다는 전제보다 현재 데이터가 있는 곳과 실제 Compute가 실행되는 곳을 연결하는 것에 초점을 둡니다.
ARTIFACT FLOW
AI Workload에서는 데이터가 한 번만 움직이지 않습니다. Training 전후와 Workload 사이에서 서로 다른 종류의 대규모 Artifact가 계속 이동합니다.
Dataset과 Model은 ML Pipeline에서 이미 일급 Artifact로 취급되고 있습니다. INNORIX는 이러한 Artifact의 의미나 Lineage를 새로 관리하는 대신, 그 Artifact를 구성하는 실제 파일을 필요한 Infrastructure 사이에서 전달하는 역할을 맡습니다.
TRANSFER PROFILE
AI Dataset의 Transfer Profile은 일정하지 않습니다. 하나의 거대한 Artifact일 수도 있고, 수백만 개의 이미지나 작은 데이터 파일로 구성될 수도 있으며, 새로운 데이터가 지속적으로 추가될 수도 있습니다.
AI Data Delivery는 이를 위해 별도의 AI 전용 복사 방식을 만드는 것이 아니라 INNORIX의 High-Speed, Large File, High-Volume, Automated Transfer를 AI Infrastructure의 Data Path에 적용합니다.
READY TIME
AI 환경에서 중요한 것은 전송 속도 숫자만이 아닙니다.
Compute가 사용할 Dataset이 언제 준비되는지, 새로운 Compute가 생성되었을 때 필요한 데이터를 얼마나 빠르게 전달할 수 있는지, 전송이 중단되었을 때 어디부터 다시 시작하는지가 실제 Data Readiness에 영향을 줍니다.
GPU Utilization이나 Job Scheduling은 기존 Infrastructure가 담당합니다. INNORIX는 그 Compute가 사용할 실제 데이터를 준비하는 Transfer 구간에 집중합니다.
STAGING LAYER
AI Infrastructure가 여러 환경으로 확장될수록 Data Movement 역시 여러 방식으로 만들어지기 쉽습니다.
Staging Copy
Direct Transfer
Control은 INNORIX Platform에서 관리하고, Data는 필요한 Source와 Target 사이에서 이동하도록 구성합니다.
Dataset Delivery를 위해 별도의 Temporary Copy, Staging Path와 Transfer Script를 계속 추가하는 대신 Data Movement 자체를 재사용 가능한 Infrastructure로 운영할 수 있습니다.
ORCHESTRATOR CALL
AI Data Delivery는 새로운 AI Workflow Engine이 아닙니다. Kubeflow Pipelines와 같은 시스템이 이미 관리하는 Pipeline 실행 순서와 Artifact 관계 안에서, INNORIX는 Data Transfer를 실행하는 독립적인 단계가 됩니다.
어떤 Job을 실행할지, 언제 Training을 시작할지, 성공 이후 어떤 Component를 실행할지는 Orchestrator가 결정합니다.
INNORIX는 요청받은 Data Delivery를 실행하고 상태와 완료 결과를 기존 Workflow에 반환하는 역할을 담당합니다.
PIPELINE FIRST
이미 구축된 AI Pipeline을 INNORIX 방식으로 다시 정의할 필요는 없습니다.
Kubeflow / Existing Orchestrator
AI Data Delivery
AI Platform은 Dataset URI, Model Artifact, Pipeline Dependency와 Workload를 계속 관리합니다.
INNORIX는 해당 Pipeline에서 필요한 Storage A → Compute B, Compute B → Storage C와 같은 실제 Transfer를 수행합니다. 따라서 새로운 AI Platform을 추가하는 것이 아니라 기존 AI Platform이 사용할 수 있는 Data Movement Layer를 추가하는 구조입니다.
DELIVERY MODES
AI Data Delivery는 Dataset Migration으로 시작해 지속적인 Data Pipeline으로 확장할 수 있습니다.
Delivery Modes
Orchestration은 기존 AI Platform이 유지하고, 반복되는 실제 Data Movement만 Transfer Layer로 분리할 수 있습니다.
DYNAMIC COMPUTE
AI Compute는 점점 더 동적으로 할당되고 있으며, Scheduler는 Workload를 적절한 Node에 배치하는 역할을 담당합니다. INNORIX는 Scheduling에 개입하지 않고, Scheduler가 어디에서 Workload를 실행할 것인지 결정한 이후 해당 Compute에 필요한 Dataset과 Model을 전달합니다.
이 구조는 Dynamic Endpoint Transfer와 자연스럽게 연결됩니다. AI Data Delivery는 어떤 데이터를 전달할 것인가에 집중하고, Dynamic Endpoint Transfer는 변화하는 Infrastructure에서 실제 Target을 어떻게 연결할 것인가를 확장합니다.
MULTI ENVIRONMENT
AI Infrastructure는 하나의 Cloud나 하나의 Cluster 안에서 끝나지 않을 수 있습니다.
Object Storage · Data Center · Private Storage
기업 내부 Dataset을 Cloud Compute로 전달하고, Cloud에서 생성된 결과를 Private Environment로 회수하거나, Object Storage의 Dataset을 서로 다른 AI Compute에서 사용할 수 있습니다. 이때 각각의 조합을 별개의 Data Copy Project로 만들기보다 Storage ↔ Compute의 Data Movement를 하나의 Transfer Layer에서 운영합니다.
TRANSFER RECOVERY
대규모 Dataset에서는 전송 실패 자체보다 실패 이후의 처리 방식이 중요합니다.
전체 Dataset을 처음부터 다시 전달하는 대신 전송 상태를 유지하고, 중단된 Transfer를 Resume하며, 필요한 파일만 Selective Retry하고, 파일별 결과를 확인할 수 있습니다.
10,000,000 Files
Transfer의 성공 여부를 Training Framework나 Orchestrator의 Log에서 추측하는 대신 INNORIX의 Runs, File Status, Transfer History와 Receipt에서 Data Delivery 자체의 결과를 확인합니다.
API INTERFACE
기존 AI Platform은 Data Delivery를 외부 Transfer Operation으로 호출할 수 있습니다.
이를 통해 AI Platform은 자신의 Workflow와 Scheduling Logic을 그대로 유지하면서 필요한 시점에 Data Delivery를 요청하고 결과를 받아 다음 단계로 진행할 수 있습니다.
FULL LIFECYCLE
AI Data Delivery의 범위는 Training 시작 전 Dataset Copy에 한정되지 않습니다.
각 단계의 실행과 Dependency는 기존 AI Orchestrator가 관리합니다.
INNORIX는 그 사이에서 발생하는 Dataset, Model, Checkpoint와 Result의 실제 Data Movement를 동일한 Transfer Layer로 연결합니다.
CLEAR BOUNDARY
두 영역을 겹치게 만들 필요가 없습니다. 기존 AI Platform은 Compute와 Workload를 계속 운영하고, INNORIX는 그 Infrastructure 사이에서 실제 데이터를 움직입니다.
GET STARTED
Object Storage, Data Center, Cloud와 Private Storage에 존재하는 Dataset을 필요한 AI Compute로 전달하고, Training과 Inference에서 생성되는 Model, Checkpoint와 Result를 다음 목적지로 다시 연결합니다.
기존 Scheduler와 AI Orchestrator는 그대로 사용하면서 Storage ↔ Compute ↔ Storage 사이의 Data Movement를 하나의 Transfer Layer로 운영합니다.