Как я строю пайплайны для обработки 10 ТБ данных в день
Data Engineering — это невидимая работа. Пользователи видят красивые графики, но не видят пайплайны, которые делают это возможным.
Я работаю в финтехе, и наши данные — это транзакции миллионов людей. Каждый день мы обрабатываем 10 терабайт. Это как 10 миллионов книг в день.
Мой главный инструмент — Apache Spark. Он позволяет обрабатывать данные распределённо, на кластере из сотен машин. Это сложно, но когда всё работает — это магия. Данные текут как река, и я — инженер этой реки.
Вернуться ко всем постам
Комментарии 0
Будьте первым, кто оставит комментарий!