Книга: Наука о данных: Базовый курс
Назад: Глава 2. ЧТО ТАКОЕ ДАННЫЕ И ЧТО ТАКОЕ НАБОР ДАННЫХ?
Дальше: Глава 4. ОСНОВЫ МАШИННОГО ОБУЧЕНИЯ
Глава 3

Экосистема науки о данных

Набор технологий, используемых для обработки данных, варьируется в зависимости от организации. Чем больше организация и/или объем обрабатываемых данных, тем сложнее технологическая экосистема науки о данных. Обычно эта экосистема содержит инструменты и узлы от нескольких поставщиков программного обеспечения, которые обрабатывают данные в разных форматах. Существует ряд подходов, которые организация может использовать для разработки собственной экосистемы науки о данных. На одном конце этого ряда организация принимает решение инвестировать в готовую систему интегрированных инструментов. На другом — самостоятельно создавать экосистему путем интеграции инструментов и языков с открытым исходным кодом. Между этими двумя крайностями есть несколько поставщиков программного обеспечения, которые предоставляют решения, являющие собой смесь коммерческих продуктов и продуктов с открытым исходным кодом. Однако, хотя конкретный набор инструментов в каждой организации будет свой, наука о данных предусматривает общие компоненты для большинства архитектур.

Рис. 6 дает обзор типичной архитектуры данных. Эта архитектура предназначена не только для больших данных, но и для данных любого размера. Диаграмма состоит из трех основных частей: уровня источников данных, на котором генерируются все данные в организации; уровня хранения данных, на котором данные хранятся и обрабатываются, и уровня приложений, на котором данные передаются потребителям этих данных и информации, а также различным приложениям.

Назад: Глава 2. ЧТО ТАКОЕ ДАННЫЕ И ЧТО ТАКОЕ НАБОР ДАННЫХ?
Дальше: Глава 4. ОСНОВЫ МАШИННОГО ОБУЧЕНИЯ