클라우드 스토리지 간 전송

IT 엔지니어개발자

시작하기

기본 개념

클라우드 서비스와 계정·리전 사이에서 파일과 오브젝트 전송하기

파일과 오브젝트는 클라우드 서비스, 계정, 프로젝트, 리전에 따라 각각 다른 저장 환경에서 관리됩니다.

클라우드 스토리지 간 전송은 원본 스토리지의 파일과 오브젝트를 지정된 대상 스토리지로 전송하고, 필요한 계정과 리전 사이의 데이터 이동 경로를 구성하는 방식입니다.

text
Source Storage
      │
      ▼
Transfer Flow
      │
      ▼
Target Storage

예를 들어 Amazon S3에서 Azure Blob으로 전송하거나, 같은 클라우드 서비스 내의 서로 다른 계정과 리전을 연결해 파일 흐름을 구성할 수 있습니다.

전송 흐름

원본 선택부터 대상 스토리지 반영까지 연결하기

클라우드 간 전송은 원본 스토리지와 대상 스토리지를 연결한 후, 전송할 파일을 선택하고 설정한 경로에 반영하는 흐름으로 진행합니다.

text
원본 스토리지
      │
      ▼
계정·리전 연결
      │
      ▼
전송 경로 설정
      │
      ▼
파일·오브젝트 전송
      │
      ▼
대상 스토리지 반영

활용 효과

분산된 클라우드 데이터를 필요한 환경으로 이동하기

클라우드 스토리지 간 전송을 활용하면 서비스, 계정, 리전에 분산된 데이터를 업무와 운영 환경에 맞는 저장 위치로 이동할 수 있습니다.

활용 환경전송 흐름
서비스 간 이동Amazon S3 → Azure Blob
계정 간 이동Account A → Account B
리전 간 이동Region A → Region B
처리 결과 관리Processing Storage → Archive Storage

IT 엔지니어

클라우드 간 대용량 파일 전송 환경을 구성하고 운영하기

스토리지 연결

전송할 클라우드 환경과 접근 범위 구성하기

먼저 Amazon S3, Azure Blob, GCS, Cloudflare R2 등 사용할 클라우드 스토리지를 연결합니다.

각 스토리지의 계정, 프로젝트, 리전과 접근 범위를 설정해 전송 작업에 사용할 환경을 구성합니다.

text
Amazon S3 ──────┐
Azure Blob ─────┤
GCS ────────────┼──→ Transfer Environment
Cloudflare R2 ──┘

이 단계에서 전송 환경과 접근 범위를 함께 구성하므로, 기존의 스토리지 연결계정·리전 내용을 하나의 단계로 병합합니다.

전송 경로

원본 버킷과 대상 저장 위치 연결하기

전송에 사용할 원본 버킷 또는 컨테이너와 대상 저장 위치를 지정하고 파일 이동 경로를 구성합니다.

필요한 경우 서로 다른 서비스, 계정, 리전의 저장 위치를 하나의 전송 작업으로 연결할 수 있습니다.

text
Source
Account A / Region 1
Bucket: media-source
          │
          ▼
      Transfer
          │
          ▼
Target
Account B / Region 2
Bucket: media-archive

전송 기준

파일 규모와 처리 조건에 맞춰 전송 작업 구성하기

대용량 파일과 다수의 오브젝트를 전송할 때는 처리할 파일 범위와 실행 조건을 함께 설정합니다.

파일 경로, 유형, 이름 등의 조건을 기준으로 전송 대상을 지정하고, 정해진 일정이나 파일 생성, 외부 요청에 따라 작업을 실행하도록 구성할 수 있습니다.

text
Source Storage
       │
       ▼
   Transfer Rules
       │
 ┌─────┼──────────┐
 ▼                ▼
Files          Objects
 │                │
 └──────┬─────────┘
        ▼
   Transfer Run
        │
        ▼
 Target Storage

기존의 대량 전송전송 조건은 실제 전송 작업을 구성하는 기준이라는 공통 목적을 가지므로 하나의 단계로 병합합니다.

결과 확인

전송된 파일과 대상별 처리 상태 확인하기

전송 작업이 실행되면 Runs에서 원본과 대상 스토리지, 진행률, 처리된 파일 수와 전체 용량, 실행 상태를 확인할 수 있습니다.

text
Transfer Run
     │
     ├── Source / Target
     │
     ├── Trigger
     │
     ├── Progress
     │
     └── Status

작업별 실행 결과를 확인하면 각 대상 스토리지에 파일과 오브젝트가 반영된 상태를 관리할 수 있습니다.

운영 관리

여러 클라우드 환경의 전송 작업을 중앙에서 관리하기

여러 클라우드 서비스와 계정, 리전을 사용하는 경우에는 각 전송 작업의 실행 기록과 처리 상태를 함께 확인할 수 있습니다.

특정 전송 작업에서 추가 확인이 필요한 경우 상세 실행 결과를 확인하고 필요한 작업을 다시 실행합니다.

text
             Cloud Operations
                    │
       ┌────────────┼────────────┐
       ▼            ▼            ▼
   S3 Transfer  Azure Transfer  GCS Transfer
       │            │            │
       └────────────┼────────────┘
                    ▼
             Runs & Results

관리 항목확인 내용
클라우드 환경서비스, 계정과 리전
전송 경로원본과 대상 저장 위치
전송 기준파일 범위와 실행 조건
실행 상태진행 중인 작업과 완료 결과
처리 결과전송된 파일과 오브젝트 정보

개발자

서로 다른 클라우드 스토리지 간에 오브젝트를 전송하고 개수를 대조해 확인하기

연동 준비

공통 호출 코드와 상태 값 준비하기

import os
import requests

BASE_URL = os.getenv("INNORIX_BASE_URL", "https://app.innorix.com").rstrip("/")
TOKEN = os.environ["INNORIX_ACCESS_TOKEN"]
WORKSPACE_ID = os.getenv("INNORIX_WORKSPACE_ID")   # optional; falls back to the current workspace

STATUS_COMPLETE = 2
TERMINAL = {2, 4, 5, 9, 99}          # complete / error / cancelled / partial / failed
NOT_SUCCEEDED = {4, 5, 9, 99}


def api(method, path, body=None, params=None):
    headers = {
        "Content-Type": "application/json",
        "Authorization": f"Bearer {TOKEN}",
    }

    if WORKSPACE_ID:
        headers["x-workspace-id"] = WORKSPACE_ID

    response = requests.request(
        method, BASE_URL + path,
        headers=headers, json=body, params=params, timeout=30,
    )

    payload = response.json() if response.content else {}

    if not response.ok:
        raise RuntimeError(payload.get("message") or f"HTTP {response.status_code}")

    return payload.get("data")


def is_terminal(detail):
    return detail.get("isTerminal", detail.get("status") in TERMINAL)

전송 상태는 아래 값으로 판단합니다. 종료 상태는 다섯 개이고 성공에 해당하는 값은 완료(2)입니다.

상태 값의미종료
2완료
4오류
5취소
9부분 완료
99실패
1 · 6 · 12 · 13시작·전송 중·동기화 중·수신 중아니오

스토리지 지정

연결된 스토리지의 장비 식별자와 경로 정하기

연결된 클라우드 스토리지는 전송 대상 장비로 나타납니다. 목록에서 식별자를 확인합니다.

result = api("GET", "/api/devices", params={"page": 1, "size": 200}) or {}

for device in result.get("devices") or []:
    print(device["deviceId"], device["name"], device.get("os"))

장비 목록은 data.devices 배열로 반환됩니다.

이름으로 다룬다면 식별자로 바꿉니다. 계정과 리전이 다른 같은 서비스가 여러 개 연결된 경우 이름이 비슷해 혼동될 수 있습니다.

def resolve_device(name):
    result = api("GET", "/api/devices/resolve", params={"name": name}) or {}
    devices = result.get("devices") or []
    count = result.get("matchCount", len(devices))

    if count != 1 or not devices:
        raise RuntimeError(f"{name}: {count} matches - use a more specific name")

    return devices[0]["deviceId"]

버킷과 컨테이너 아래의 경로는 접두사를 그대로 씁니다. 스토리지 서비스가 접두사 형태의 경로를 그대로 받으므로 별도로 가공하지 않습니다.

전송 실행

원본 접두사의 오브젝트를 대상으로 보내기

def move_objects(source, target, source_prefix, target_prefix):
    transfer = api("POST", "/api/transfers/manual", {
        "sourceDevice": source,
        "targetDevice": target,
        "targetPath": target_prefix,
        "sourcePaths": [source_prefix],
        "sendAllFolder": True,
        "transferOptions": {"target-action": "overwrite"},
    })

    return transfer["monitorId"]

서비스 간 이동에서는 overwrite가 안전합니다. numbering을 쓰면 오브젝트 키가 바뀌어 애플리케이션이 참조하던 경로와 어긋납니다.

전송할 대상을 미리 확인하려면 원본 스토리지의 목록을 조회합니다.

result = api("GET", f"/api/devices/{SOURCE}/files", params={
    "path": "media/2026/09",
    "page": 1, "size": 200, "type": "file",
})

print(result.get("total"), "objects")

if result.get("truncated"):
    print("result was truncated - narrow the prefix")

대량 오브젝트 처리

접두사로 나눠 여러 전송으로 옮기기

버킷 하나에 수백만 개의 오브젝트가 있으면 한 번에 보내기 어렵습니다. 접두사로 나누면 실패한 구간만 재전송할 수 있습니다.

PREFIXES = [f"media/2026/{month:02d}" for month in range(1, 13)]

transfers = {
    prefix: move_objects(SOURCE, TARGET, prefix,
                         prefix.replace("media", "archive", 1))
    for prefix in PREFIXES
}
def wait(monitor_id, timeout=3600, interval=3):
    deadline = time.time() + timeout

    while time.time() < deadline:
        detail = api("GET", f"/api/transfers/{monitor_id}")

        if is_terminal(detail):
            return detail

        time.sleep(interval)

    raise TimeoutError(monitor_id)


def failed_files(monitor_id):
    result = api("GET", f"/api/transfers/{monitor_id}/files", params={
        "state": "any", "size": 500,
    }) or {}

    return [r for r in (result.get("children") or [])
            if r.get("status") in NOT_SUCCEEDED]


def retry_failed(monitor_id):
    rows = failed_files(monitor_id)

    if not rows:
        return 0

    api("POST", f"/api/transfers/{monitor_id}/retry", {
        "filesRetry": [
            {"filePath": r["sourceFilePath"], "isDir": bool(r.get("isFolder"))}
            for r in rows
        ]
    })

    return len(rows)
for prefix, monitor_id in transfers.items():
    detail = wait(monitor_id, timeout=14400)

    print(f"{prefix:24} {detail.get('statusName')}"
          f" {detail.get('fileCount')} objects {detail.get('totalSize')} bytes")

    if detail["status"] != STATUS_COMPLETE:
        print(f"  retried {retry_failed(monitor_id)} files")

한 범위가 실패해도 나머지를 계속 확인해야 어디까지 옮겼는지 알 수 있습니다.

조건부 전송

유형과 크기로 옮길 오브젝트 고르기

전체가 아니라 특정 파일만 옮겨야 하는 경우가 많습니다.

def build_filter(exts=None, min_size=None, exclude=None):
    file_option = {}

    if exts:
        # extension whitelist, without the leading dot
        file_option["extension"] = {
            "extension": [e.lstrip(".").lower() for e in exts],
            "allow": True,
        }

    if min_size is not None:
        # over and equal both True means size or larger
        file_option["fileSize"] = {"size": min_size, "over": True, "equal": True}

    if exclude:
        # allow=False excludes files whose name contains this. Server matching is case sensitive.
        file_option["fileName"] = {"name": exclude, "allow": False}

    return {"send-fileoption": file_option} if file_option else {}

확장자 필터는 send-fileoption.extension을 씁니다. send-filetype-cus 정규식은 확장자를 뗀 파일명에만 매칭되므로 확장자 조건으로는 동작하지 않습니다.

필터위치동작
확장자send-fileoption.extensionallow: true 면 이 확장자만 전송
크기send-fileoption.fileSizeover·equal 로 이상·이하 지정
이름send-fileoption.fileNameallow: false 면 포함된 파일 제외

여러 필터를 함께 주면 AND로 결합됩니다. 모두 통과한 파일만 전송됩니다.

options = {
    **build_filter(exts=["mp4", "mov"], min_size=1048576),
    "target-action": "overwrite",
}

api("POST", "/api/transfers/manual", {
    "sourceDevice": SOURCE,
    "targetDevice": TARGET,
    "targetPath": "archive/2026/09",
    "sourcePaths": ["media/2026/09"],
    "sendAllFolder": True,
    "transferOptions": options,
})

변경분 전송

마지막 이동 이후 추가된 오브젝트만 보내기

같은 접두사를 주기적으로 옮기는 구성이라면 전체를 재전송할 필요가 없습니다.

transfer = api("POST", "/api/transfers/manual", {
    "sourceDevice": SOURCE,
    "targetDevice": TARGET,
    "targetPath": "archive/2026/09",
    "sourcePaths": ["media/2026/09"],
    "sendAllFolder": True,
    "incremental": True,
    "transferOptions": {"target-action": "overwrite"},
})

기본값은 꺼짐입니다. 변경분 계산은 에이전트가 수행하며, 마지막 이동 이후 추가되거나 수정된 오브젝트만 전송합니다. 증분에는 반드시 overwrite를 씁니다.

결과 확인

원본과 대상의 오브젝트 수를 대조해 확인하기

오브젝트 스토리지는 파일 시스템과 달리 체크섬 조회를 지원하지 않는 경우가 있습니다. 원본과 대상의 오브젝트 수를 대조해 누락 없이 전송됐는지 확인합니다.

def count_objects(device, prefix):
    total, page = 0, 1

    while True:
        result = api("GET", f"/api/devices/{device}/files", params={
            "path": prefix,
            "page": page, "size": 1000, "type": "file",
        }) or {}

        total += len(result.get("items") or [])

        if page >= (result.get("lastPage") or 1):
            return total

        page += 1


source_count = count_objects(SOURCE, "media/2026/09")
target_count = count_objects(TARGET, "archive/2026/09")

if source_count != target_count:
    raise RuntimeError(
        f"object counts differ: source {source_count} / target {target_count}")

수가 다르면 이동이 덜 된 것입니다. 실패한 접두사 구간을 다시 전송해 수를 맞춥니다.

확인 항목확인 내용
스토리지원본과 대상의 장비 식별자
전송 경로버킷과 접두사
범위나눠 처리한 접두사 단위
결과범위별 성공과 실패
검증원본과 대상의 오브젝트 수 일치 여부