이직한 회사에서 쓰는 용어들을 쫌쫌따리 적어야겠다.....
1. AWS DMS
AWS DMS를 이용한 CDC 데이터 실시간 수집 및 분석 데이터 파이프라인 구축하기 | Amazon Web Services
관계형 데이터베이스(RDBMS)는 데이터를 저장하고, 분석하고자 할 때 가장 많이 사용되는 솔루션 입니다. 하지만, RDBMS로 처리하기 어려울 만큼 많은 양의 데이터를 저장하고 관리해야 하는 상황
aws.amazon.com
- AWS DMS는 Amazon Aurora MySQL 데이터베이스의 binlog를 읽어서 insert, update, 또는 delete 되는 CDC 데이터를 실시간으로 Kinesis Data Streams에 저장합니다.
- Kinesis Data Streams에 수집된 CDC 데이터는 Amazon Data Firehose를 이용해서 Amazon S3와 OpenSearch Service에 저장됩니다.
- Amazon OpenSearch를 이용해서 실시간으로 데이터를 분석할 수 있습니다. 동시에 Amazon S3는 데이터 레이크로 사용해서 대용량 데이터 분석을 하거나 머신 러닝에 필요한 학습 데이터 준비 작업에도 활용할 수 있습니다.
2. AWS MSK
Managed Kafka - Amazon Managed Streaming for Apache Kafka(Amazon MSK) - AWS
Amazon MSK는 안전하고 가용성이 뛰어난 완전관리형 Apache Kafka 서비스로서, 저렴한 비용으로 스트리밍 데이터를 실시간으로 손쉽게 수집하고 처리하게 해줍니다.
aws.amazon.com
Kafka를 직접 운영하면 브로커 서버 관리, 설정, 모니터링, 업그레이드 등 손이 많이 가는데, MSK는 이런 인프라 운영을 AWS가 대신해줌.
- 브로커 자동 프로비저닝 및 스케일링
- Multi-AZ 고가용성
- CloudWatch 모니터링 연동
- IAM 기반 접근 제어
MSK = Kafka의 토픽/파티션/브로커 개념 + 인프라 관리 AWS
aws_kafka_offset_lag
- Kafka에서 Offset: 파티션 안에서의 메시지 위치 번호. 메시지가 쌓일수록 번호가 올라감.
- Log End Offset — 파티션에 마지막으로 들어온 메시지 위치 (Producer가 쓴 최신 위치)
- Consumer Offset — Consumer가 지금까지 읽은 위치
Offset Lag = Log End Offset - Consumer Offset : Consumer가 아직 못 읽은 메시지 수
Lag이 늘어나는 상황
- Consumer 서버가 죽었을 때
- 처리 로직이 너무 느릴 때 (DB 병목 등)
- 트래픽이 갑자기 폭발적으로 늘었을 때
- Consumer 수가 파티션 수보다 부족할 때
'Cloud' 카테고리의 다른 글
| [Cloud] 쿠버네티스란? - 오브젝트 (2) | 2025.07.11 |
|---|---|
| [MSA] 멀티 모듈과 MSA (0) | 2025.05.30 |
| [Cloud] CD(지속적 배포 : Continuous Deployment) (0) | 2024.12.04 |
| [Cloud] GitHub Actions 를 통한 CI (feat. gradlew) (2) | 2024.12.04 |
| [Cloud] CI(지속적 통합 : Continuous Integration) (1) | 2024.12.01 |