728x90
반응형

Infra 19

[Data Platform] KEDA 오토스케일링 가이드 (멀티 트리거 설계 feat. Airflow·Spark)

Intro 안녕하세요. 환이s입니다 👋 지난 글에서는 KEDA를 Harbor + ArgoCD 기반으로 구축하고,외부 모듈 연동을 위한 RBAC까지 구성하는 과정을 정리해 봤습니다. 이번 글에서는 그렇게 설치한 KEDA를 실제로 활용해서,이벤트 기반 멀티 트리거 ScaledObject를 설계하는 방법을 정리해보려고 합니다. 실측으로 스케일 값을 계산하고,성경이 다른 두 신호 (양·지연)를 조합하고,스케일업·다운을 비대칭으로 설계하는 이 원칙들은 특정 워크로드에 국한되지 않습니다. 다만 개념만 나열하면 와닿지 않으니,이번 편에서는 Airflow의 Celery Worker를 스케일 대상 예시로 삼아설계 과정을 처음부터 끝까지 따라갑니다. 지금까지 구축한 파이프라인은 Airflow가 DAG를 돌리고그 안에서 ..

[Data Platform] KEDA 구축 가이드(Operator 설치부터 API 연동용 RBAC까지)

Intro 안녕하세요. 환이s입니다 👋 지난 글에서는 데이터 레이크하우스 플랫폼을 GitOps 방식으로 관리하기 위해ArgoCD를 Kubernetes 위에 구축하고 App of Apps 패턴으로 전체 스택을 운영하는 과정을 정리해 봤습니다. 이번 글에서는 그 위에 얹을 오토스케일링 스택, KEDA(Kubernetes Event-driven Autoscaling) 를 Harbor 레지스트리와 ArgoCD 기반으로 구축하는 과정을 정리해보려고 합니다. 단순히 CPU/Memory 기반으로 동작하는 HPA와 달리,KEDA는 Redis 큐 길이나 Prometheus 메트릭 같은 실제 이벤트를 기준으로 Pod를 0~N개까지 스케일 할 수 있습니다. Airflow처럼 "작업이 몰릴 때만 Worker가 필요한..

[Data Platform] ArgoCD GitOps 운영 가이드(App of Apps 패턴으로 플랫폼 관리)

Intro 안녕하세요. 환이s입니다 👋 지난 글에서는 데이터 레이크하우스 플랫폼의 여덟 번째 스택으로 ArgoCD를 Kubernetes 위에 구축하고 Harbor private registry와 연동하는 과정을 정리해 봤습니다. 이번 글에서는ArgoCD의 App of Apps 패턴을 활용해서Kafka, Airflow, Spark 등 플랫폼 전체 스택을 GitOps로 관리하는 방법을 정리해보려고 합니다. ArgoCD를 설치했다고 해서 GitOps가 완성된 것은 아닙니다.어떤 패턴으로 앱을 관리할지 설계하는 것이 핵심입니다. 이번 글에서는App of Apps 패턴의 개념과 왜 사용하는지Git 저장소의 디렉토리 구조 설계 방법Root Application 설정 방법실제 앱 추가/삭제 워크플로우Web UI에..

[Data Platform] ArgoCD 구축 가이드 (Helm + Private Registry + Ingress 구성)

Intro 안녕하세요. 환이s입니다 👋 지난 글에서는 데이터 레이크하우스 플랫폼의 일곱 번째 스택으로 Superset을 Kubernetes 위에 구축하고Trino와 연동해서 Delta Lake 데이터를 시각화하는 과정을 정리해 봤습니다. 이번 글에서는 여덟 번째 스택,ArgoCD를 Kubernetes 환경에 구축하고플랫폼 전체를 GitOps 방식으로 관리하기 위한 기반을 구성하는 과정을 정리해보려고 합니다. 지금까지 Kafka → Spark → Delta Lake → Trino → Superset 까지 구축했다면,이제 이 모든 스택을 코드로 관리하고 자동으로 배포하는 도구가 필요합니다. 그 역할을 담당하는 것이 바로 ArgoCD입니다. 이번 글에서는Harbor private registry에서 이미..

[Data Platform] Superset 구축 가이드 (feat. Trino 연동)

Intro 안녕하세요. 환이s입니다 👋 지난 글에서는 데이터 레이크하우스 플랫폼의여섯 번째 스택으로 Prometheus + Grafana를 Kubernetes 위에 구축하고클러스터 모니터링 환경을 구성하는 과정을 정리해 봤습니다. 이번 글에서는 일곱 번째 스택,Superset을 Kubernetes 환경에 구축하고Trino와 연동해서 Delta Lake 데이터를 시각화하는 과정을 정리해보려고 합니다. 지금까지 구축한 파이프라인에서Kafka → Spark → Delta Lake → Trino까지 데이터가 흘러왔다면,이제 이 데이터를 비즈니스 관점으로 시각화할 도구가 필요합니다. 그 역할을 담당하는 것이 바로 Superset입니다. 이번 글에서는Trino 드라이버가 포함된 커스텀 이미지를 빌드하고 Harb..

[Data Platform] Prometheus + Grafana 구축 가이드 (feat. kube-prometheus-stack)

Intro 안녕하세요. 환이s입니다 👋 지난 글에서는 데이터 레이크하우스 플랫폼의 다섯 번째 스택으로 Airflow를 Kubernetes 위에 구축하고 Spark Job을 스케줄링하는 전체 파이프라인을 정리해 봤습니다. 이번 글에서는 여섯 번째 스택, Prometheus + Grafana를 Kubernetes 환경에 구축하는 과정을 정리해보려고 합니다. 지금까지 구축한 Kafka, Spark, Ceph, Trino, Airflow가 실제로 잘 동작하고 있는지 한눈에 확인하려면 모니터링 환경이 필요합니다. 그 역할을 담당하는 것이 Prometheus와 Grafana입니다. 이번 글에서는kube-prometheus-stack으로 Prometheus + Grafana + Alertmanager + Node..

[Data Platform] Airflow 구축 가이드 (feat. Spark on Kubernetes)

Intro 안녕하세요. 환이s입니다 👋 지난 글에서는 데이터 레이크하우스 플랫폼의 네 번째 스택으로 Trino + Hive Metastore + PostgreSQL 3계층 구조로 Delta Lake SQL 조회 환경을 구축하는 과정을 정리해 봤습니다. 이번 글에서는 다섯 번째 스택, Airflow를 Kubernetes 환경에 구축하는 과정을 정리해보려고 합니다. Spark Streaming으로 처리된 데이터는 Delta Lake 포맷으로 Ceph S3에 쌓이게 됩니다. 이 흐름을 주기적으로 실행하고 스케줄링하려면 워크플로우 오케스트레이터가 필요한데, 그 역할을 담당하는 것이 바로 Airflow입니다. 이번 글에서는Helm으로 Airflow를 Kubernetes 위에 설치하는 방법CeleryExecut..

[Data Platform] Trino 구축 가이드 (feat. Hive Metastore + Delta Lake)

Intro 안녕하세요. 환이s입니다 👋 지난 글에서는 데이터 레이크하우스 플랫폼의 세 번째 스택으로 Strimzi Operator 기반의 Kafka 클러스터를 Kubernetes 위에 구축하는 과정을 정리해 봤습니다. 이번 글에서는 네 번째 스택, Trino를 Kubernetes 환경에 구축하는 과정을 정리해보려고 합니다. Kafka에서 수집되어 Spark Streaming으로 처리된 데이터는 Delta Lake 포맷으로 Ceph S3에 쌓이게 됩니다. 이 데이터를 SQL로 조회하려면 쿼리 엔진이 필요한데, 그 역할을 담당하는 것이 바로 Trino입니다. Trino를 Kubernetes 위에서 운영하다 보면 단순히 쿼리 엔진 하나를 띄우는 것에서 끝나는 게 아니라,Hive Metastore가 Del..

[Data Platform] Apache Kafka 구축 가이드 (feat. KRaft 모드)

Intro 안녕하세요. 환이s입니다 👋 지난 글에서는 데이터 레이크하우스 플랫폼의두 번째 스택으로 Spark Operator를 Kubernetes 위에 구축하고Delta Lake + Ceph S3 연동까지 정리해 봤습니다. 이번 글에서는 세 번째 스택,Apache Kafka를 Kubernetes 환경에 구축하는 과정을 정리해보려고 합니다. Kafka를 Kubernetes 위에서 운영하다 보면단순히 브로커를 띄우는 것에서 끝나는 게 아니라,Strimzi Operator가 Kafka 클러스터를 Kubernetes 리소스로 선언형으로 관리하고KRaft 모드로 Zookeeper 없이 브로커가 직접 메타데이터를 관리하고KafkaNodePool로 브로커를 풀 단위로 나눠서 운영하고AKHQ로 토픽과 메시지를 U..

[Data Platform] Rook-Ceph 구축 가이드(Block / FileSystem / Object Store)

Intro 안녕하세요. 환이s입니다 👋최근 사내에서 데이터 레이크하우스 플랫폼을 직접 구축하는 프로젝트를 진행했습니다. 단순히 데이터를 쌓는 것에서 끝나는 게 아니라, 수집 → 저장 → 처리 → 분석 → 시각화까지 이어지는 전체 데이터 파이프라인을 오픈소스 기반으로 직접 설계하고 올려보는 작업이었는데요. 이번 시리즈에서는 그 과정에서 구축한 스택들을 하나씩 순서대로 정리해보려고 합니다. 전체 구성은 아래와 같습니다.역할오픈소스분산 스토리지Ceph스트리밍 파이프라인Kafka대규모 데이터 처리Spark쿼리 엔진Trino워크플로우 오케스트레이션Airflow인프라 모니터링Prometheus / Grafana데이터 시각화Superset 그 첫 번째 주제로, 모든 데이터가 실제로 저장되는 기반 스토리지인 Roo..

728x90
반응형