Как я строю пайплайны для 10 ТБ данных
Data Engineering — невидимая работа. Пользователи видят графики, но не видят пайплайны.
Я работаю в финтехе, наши данные — транзакции миллионов людей. Каждый день обрабатываем 10 терабайт. Это как 10 миллионов книг в день.
Мой инструмент — Apache Spark. Он позволяет обрабатывать данные распределённо. Это сложно, но когда всё работает — магия. Данные текут как река, и я — инженер этой реки.
Вернуться ко всем постам
Комментарии 0
Будьте первым, кто оставит комментарий!