전체 글142 [Kafka] 5. Kafka Consumer란? 0. 개요팀에서 카프카를 쓰길래 공부하는 중이다.학습에는 '쉬운 코드' 유투브 채널과 카프카 공식 문서 참고했다. https://www.youtube.com/@ezcdhttps://kafka.apache.org/ Apache KafkaApache Kafkakafka.apache.org 1. Kafka Consumer란? : Kafka Topic에 저장된 Record를 Broker로부터 가져와 처리하는 클라이언트 Consumer Group: 같은 consumer group에 속하는 consumer들은 토픽의 Partition들을 나눠서 구독(subscribe)→ 처리량 향상- group에 consumer가 추가가되면, 새로 추가가된 consumer가 partition들을 나눠 가져가서 구독한다 = reb.. 2026. 9. 18. [Kafka] 4. Kafka Leader Epoch란? (Leader Down으로 인한 데이터 정합성 문제 해결) 0. 개요팀에서 카프카를 쓰길래 공부하는 중이다.학습에는 '쉬운 코드' 유투브 채널과 카프카 공식 문서 참고했다. https://www.youtube.com/@ezcdhttps://kafka.apache.org/ Apache KafkaApache Kafkakafka.apache.org 1. Leader Down과 데이터 정합성 문제읽어올 값은 없지만, 두 데이터가 다름. → 정합성 깨짐.ISR에 복귀를 하고, FetchRequest와 FetchResponse를 해도 여전히 데이터 차이가 발생함. 2. 정합성 문제 해결 - HW 부터 그 이후 레코드는 버리자! (KP-101 이전 시대)[규칙]1. 레플리카가 재시작 됐거나 복구 됐을 때 해당 레플리카의 HW부터 이후 레코드들을 모두 삭제 (리더, 팔로워 .. 2026. 9. 18. [Kafka] 3. Kafka Replication (Commit과 High Watermark) 0. 개요팀에서 카프카를 쓰길래 공부하는 중이다.학습에는 '쉬운 코드' 유투브 채널과 카프카 공식 문서 참고했다. https://www.youtube.com/@ezcdhttps://kafka.apache.org/ Apache KafkaApache Kafkakafka.apache.org 우선, 카프카는 커밋 종류가 두 가지가 있다. 해당 글의 주제인 Replica와 관련 있는 커밋은 Broker-side Commit인데, 헷갈리지 않게 둘 다 알아보자. 1. Consumer Commit: Consumer가 consume하여 처리한 records의 마지막 offset에 1을 더한 값. 즉, 다음 차례의 offset을 커밋. = 커밋된 offset의 직전까지 consumer에서 처리 완료됐음을 의미. [커.. 2026. 9. 16. [Elastic] 8. Distributed Operations 0. 개요Elasticsearch은 장애에 강하기 위해 샤드 단위로 데이터 복제한다. Elasticsearch가 실제로 분산 환경에서 어떻게 읽고 쓰는지에 대해 알아보자. 1. Primary: Primary는 index의 original shard이다. 데이터 write의 대상이기에, 데이터 분할 전략에 사용된다. Primary 샤드는 생성 후 수정이 안된다. 수정하려면 shard 만들고 reindex하면 된다. 2. Replica : Replica는 primary shard의 복사본으로, Primary와 동일한 데이터를 가지고 있으며 다른 Node에 배치된다.Replica는 장애 대응, 검색 성능/처리량 증가(분산 검색이 가능) 위해 사용한다.상황에 따라 replica 개수를 자율적으로 조정하고 싶.. 2026. 9. 11. [Elastic] 7. Cluster Management은 어떻게 할까 0. 개요두 개 이상의 Elasticsearch Cluster를 다루는 상황의 검색에 대해 알아보자. 1. Cross Cluster Search (CCS): 여러 Elasticsearch 클러스터에 존재하는 인덱스를 하나의 검색 요청으로 조회하는 기능. 즉, 여러 Cluster의 데이터를 이동/복제하지 않고 한 곳에서 검색하는 기능이다. 다만, CCS를 사용하려면 먼저 다른 Elasticsearch cluster가 Remote Cluster로 연결되어 있어야 한다. 장점여러 지역/클러스터에 분산된 데이터를 복제하거나 이동하지 않고, 중앙에서 통합 조회할 수 있다.여러 Elasticsearch 클러스터를 각각 따로 접속하지 않고 한 번의 search 요청으로 검색EMEA_DE_cluster라는 원격 클러.. 2026. 9. 11. [Elastic] 6. Index Lifecycle Management(ILM)과 Snapshots에 대해 0. 개요시간이 지나면서 데이터량은 늘어나지만, 비용은 한정되어 있다.모든 데이터의 중요도가 동일하지 않기에, 시간에 따라 데이터 저장 전략을 변경한다. 로그와 같은 Time Series 데이터의 특성은 최근에 들어온건 자주 조회되기에 빨리 조회되는 것이 좋다. 하지만, 오래전에 들어온 데이터는 조회 가능성이 낮기에 높은 비용의 저장소를 사용할 필요가 없어 용도에 따라 데이터의 tier를 나눴다. ⇒ 결국 비용 절감을 위한 것. 1. Data TierHOT : 현재 계속 쓰이는 데이터(유일하게 write 가능) - time series WARM : 쓰기 빈도가 낮아진 데이터 - time series COLD : 검색 빈도가 낮은 오래된 데이터 - time series FROZEN : 아주 가끔 검색 .. 2026. 9. 11. 이전 1 2 3 4 ··· 24 다음