Рис. 1. ИТ-архитектура при схеме интеграции «один-к-одному»
Чем больше разрозненных приложений и связей между ними необходимо поддерживать ИТ-подразделению, тем ниже становится управляемость такой структуры, тем более усложняются процессы поддержки и внесения изменений. В то же время такая архитектура не позволяет решать задачи получения консолидированной отчетности на уровне компании и проведения какой-либо аналитической работы. Этот момент обычно и становится началом первого этапа взросления ИТ с точки зрения интеграции данных. Принимается решение о построении корпоративного (централизованного) хранилища данных (КХД). Типовая архитектура КХД представлена на рис. 2.
Рис. 2. Архитектурная схема корпоративного хранилища данных
Одной из основных задач при построении КХД является разработка процесса загрузки данных в хранилище и их выгрузки в витрины данных, предназначенные для конкретных целей отчетности и аналитики. В классической архитектуре данный процесс носит название ETL (Extract, Transform, Load). Такое же название получил и класс программных продуктов для обеспечения надежного автоматического перемещения данных из различных источников в приемники. Именно со своим ETL-продуктом Informatica PowerCenter и появилась на рынке компания Informatica. Последние 10 лет продукт занимает одну из лидирующих позиций на рынке инструментов ETL.
На каком бы из этапов на пути эволюции интеграции данных вы ни стояли, в любом случае важно иметь инструменты для получения полной и своевременной информации
Что же дает внедрение КХД? Выгоды очевидны. Компания имеет возможность получать консолидированную отчетность и анализировать данные, полученные из различных приложений и файлов. Однако закон интеграции данных гласит: Garbage In – Garbage Out. То есть если мы имеем на входе «мусорную» информацию, то получим «мусор» и на выходе. Именно с этой проблемой зачастую сталкиваются ИТ-подразделения после внедрения КХД. Качество получаемых отчетов и аналитики напрямую зависит от качества исходных данных. Имея неполные, дублирующие друг друга, а порой просто неверные входные данные невозможно получить качественный результат. Для решения проблем их очистки и дедупликации перед загрузкой в КХД используются специализированные программные продукты, например, Informatica DataQuality. С их помощью данные проверяются на наличие дубликатов, освобождаются от ложной информации и обогащаются недостающими значениями. Результат – высокое качество отчетов и аналитических расчетов на выходе (см. рис. 3).
Рис. 3. Архитектурная схема КХД с элементом повышения качества данных
Следующим логическим этапом в эволюции интеграции данных стало появление систем класса Master Data Management (MDM). Существуют различные архитектурные подходы к их построению, но все они призваны решать одну задачу. Представьте, что при сборе информации о клиенте из различных систем предприятия выявляется такой факт: данные об одном и том же человеке, например, в системах CRM и ERP, существенно отличаются. Номера паспортов одинаковы, но адреса проживания и телефоны разные. Какой из этих двух адресов актуален? По какому телефону звонить клиенту сотрудникам отдела маркетинга? Или более сложная задача: девушка вышла замуж, взяла фамилию мужа и поменяла паспорт. В одной системе эта информация отражена, а в другой – нет. Как понять, что это один и тот же человек, и занести в КХД только актуальную и выверенную информацию? Решения класса MDM, в частности, Informatica Master Data Management, дают возможность получить ответы на все эти вопросы. Существенной особенностью продукта компании Informatica является возможность работы не только с клиентской информацией, но и с такими сущностями, как товар, контрагент, местоположение и т.д.
На рис. 4 показана одна из возможных схем встраивания системы МДМ в существующую ИТ-архитектуру.
Рис. 4. Архитектурная схема КХД с вынесенным хабом MDM
Сегодня прогресс не стоит на месте. Все чаще ИТ-подразделениям приходится сталкиваться с задачами по выгрузке и интеграции данных из социальных сетей, анализу Больших Данных (Big Data), таких как, например, файлы CDR в телекоммуникационных компаниях. Начинаются внедрения в промышленную эксплуатацию кластеров Hadoop, способных хранить и анализировать данные петабайтных объемов. Решение каждой из этих задач требует высокопрофессиональной работы ИТ-архитекторов и применения передовых технологий и инструментов по интеграции (см. рис. 5). Продукт Informatica PowerExchange легко справляется с загрузкой и выгрузкой данных из систем класса Hadoop и позволяет интегрировать их в ИТ-инфраструктуру компании.
Рис. 5. Гибридная экосистема КХД и кластер Hadoop с загрузкой данных из социальных сетей и технической информации, создаваемой различным оборудованием
Возможно, вы – молодая быстрорастущая торговая компания, которая начинает построение хранилища данных для консолидации информации о клиентах. Или вы – солидная транснациональная корпорация. Но на каком бы из этапов на пути эволюции интеграции данных вы ни стояли, в любом случае важно иметь инструменты для получения полной и своевременной информации. Только так можно одерживать верх в конкурентной борьбе и уверенно двигаться по собственному эволюционному пути. Ведь побеждает тот, кто владеет информацией.