
2011년 링크드인에서 파편화된 데이터 수집 및 분배 아키텍처를 운영하는 데 어려움을 겪음.데이터를 생성하고 적재하기 위해서는 데이터를 생성하는 소스 애플리케이션과데이터가 최종 적재되는 타깃 애플리케이션을 연결해야 한다.초기 운영 시, 단방향 통신을 통해 두 애플리케이
카프카는 실시간 데이터 스트리밍 및 데이터 파이프라인으로 주로 많이 쓰인다고 한다.카프카가 데이터 파이프라인으로 적합하기 때문인데 그 이유가 무엇일까?프로듀서가 브로커로 데이터를 보낼 때와컨슈머가 브로커로 데이터를 받을 때 모두 데이터를 묶어서 전송한다.많은 양의 데이
1) 초기 빅데이터 플랫폼 초기 빅데이터 플랫폼 기존에는 원천 데이터, 파생 데이터, 서빙 데이터로 나누어져 있었다. 원천 데이터를 특정 프로세싱을 통해서 파생 데이터로 만들어서 운영하였다. 파생 데이터를 바탕으로 애플리케이션에서 사용할 수 있도록 서빙 데이터로 만들어서 적재하여 활용하였다. 위의 방식은 End-to-End로 각 서비스 애플리케이...

카파 아키텍처람다 아키텍처의 단점을 해소하기 위해 고안된 아키텍처이다.단점으로 부각되었던 로직의 파편화, 디버깅, 배포, 운영 분리에 대한 이슈를 제거하기 위해배치 레이어를 제거한 카파 아키텍처는 스피드 레이어에서 데이터를 모두 처리할 수 있었으므로 엔지니어들은 더욱

토픽에 저장된 데이터를 처리해서 다시 토픽에 넣고자 할 때, Kafka Streams라는 라이브러리를 활용하면 된다.커넥트(Connect)는 데이터 파이프라인을 운영하는 가장 핵심적인 툴 중 하나이다.소스 커넥터와 싱크 커넥터가 있으며 소스 커넥트는 프로듀서 역할, 싱

카프카 클라이언트와 데이터를 주고받기 위해 사용하는 주체이자, 데이터를 분산 저장하여 장애가 발생하더라도 안전하게 사용할 수 있도록 도와주는 애플리케이션(프로세스)이다.