С большими данными появляются не только новые возможности для понимания окружающего мира, но и новые научные проблемы.
Первая серьезная проблема заключается в том, что большие данные и данные, которыми оперируют ученые, структурированы совершенно по-разному. Ученые предпочитают отвечать на тщательно сформулированные вопросы с помощью элегантных экспериментов, дающих воспроизводимые и точные результаты. Однако большие данные часто сопровождаются неразберихой. Типичный массив больших данных представляет собой смесь фактов и измерений, сделанных без какой-либо научной цели и с использованием далеко не универсальных процедур. Он изобилует ошибками и огромным количеством пугающих пробелов – например, недостающими элементами информации, важными для любого разумного ученого. Такие ошибки и упущения часто непоследовательны, даже в рамках единого массива данных. Это связано с тем, что большие массивы данных часто создаются путем объединения большого количества более мелких массивов данных. Очевидно, что некоторые из компонентов массивов данных более надежны, чем другие, и у каждого из них есть свои особенности. Хорошим примером может служить социальная сеть Facebook. Добавление людей «в друзья» может означать совершенно разное для разных людей. Кто-то делает это довольно свободно. Кто-то более осторожен. Некоторые добавляют в друзья коллег, другие этого не делают. Отчасти работа с большими данными как раз и требует, чтобы их хорошо понимали и учитывали все подобные особенности. Но настолько хорошо можно быть знакомым с петабайтом данных?
Вторая серьезная сложность заключается в том, что большие данные не всегда вписываются в концепцию того, что мы привыкли понимать под научным методом. Ученые любят подтверждать конкретные гипотезы и постепенно собирать свои выводы сначала в связные, а затем и математически верные теории. Стоит покопаться в любом достаточно интересном большом наборе данных, и вы неминуемо сделаете открытие – к примеру, найдете корреляцию между активизацией морского пиратства и изменением температуры в атмосфере. Такой вид исследований иногда называется «исследованием без гипотез», поскольку вы никогда не знаете в начале работы, что найдете в процессе. Тем не менее большие данные вам помогут куда меньше, если нужно объяснить такую корреляцию с точки зрения причинно-следственной связи. Вызывают ли действия пиратов глобальное потепление? Заставляет ли повышение температуры на улице заниматься пиратством? А если эти два показателя не связаны между собой, то почему они оба так сильно растут в последние годы? Большие данные часто заставляются нас теряться в догадках.
Поскольку мы продолжаем накапливать необъясненные и недостаточно объясненные факты, появилось мнение, что причинно-следственная связь как основа научного познания рискует уступить свое место корреляции. Некоторым даже кажется, что дальнейшее развитие больших данных приведет к смерти теории. Однако с такой точкой зрения вряд ли можно согласиться. Мы можем отнести к подлинным триумфам современной науки такие теории, как теория общей относительности Эйнштейна или теория естественного отбора Дарвина, объясняющие причины сложных явлений с помощью небольшого набора основополагающих принципов. Если поиск таких теорий уйдет в прошлое, то мы рискуем потерять саму суть того, что называется наукой. Какой смысл делать миллионы открытий, если мы не можем объяснить сути ни одного из них? Это не значит, что мы должны отказываться от объяснений природы вещей. Это значит лишь, что мы должны изменить принципы своей работы.
И последняя значительная проблема связана с тем, где теперь живут данные. Мы как ученые привыкли получать данные, экспериментируя в своих лабораториях или выбираясь в мир природы и фиксируя свои наблюдения. Ученый в некотором смысле контролирует получение данных. Однако в мире больших данных привратниками самых обширных массивов оказываются крупные корпорации и даже правительства. А людям, гражданам стран и клиентам компаний, далеко не безразлично, как используются эти данные. Мало кто хочет, чтобы налоговая служба США делилась данными личных налоговых деклараций с исследователями (пусть и руководствующихся самыми добрыми намерениями). Продавцы на eBay не хотят, чтобы полная информация о произведенных ими сделках становилась общедоступной или передавалась каким-то студентам-недоучкам. Лог-файлы поисковых машин и электронные письма должны по умолчанию обладать определенной степенью интимности и конфиденциальности. Авторы книг и блогов защищены законами об авторских правах. А коммерческие компании распространяют право собственности на контролируемые ими данные. Они могут анализировать эти данные с намерением получить больше от вложений в рекламу, но вряд ли согласятся поделиться своими конкурентными преимуществами с чужаками, особенно исследователями и учеными, которые вряд ли поспособствуют повышению прибыльности бизнеса.
По всем названным причинам некоторые из самых важных ресурсов в истории знания людей о самих себе остаются во многом неиспользуемыми. Несмотря на то, что изучение социальных сетей проводится уже на протяжении десятилетий, мало что делалось в масштабах всей социальной сети Facebook, поскольку компании незачем делиться своими данными. Несмотря на то, что теория рынка существует уже несколько столетий, подробности сделок на основных онлайновых торговых площадках остаются в целом недоступными для экономистов (проведенное Левиным исследование eBay было исключением из правил). И, несмотря на тот факт, что люди потратили тысячелетия, чтобы придумать географические карты, изображения, созданные компаниями типа DigitalGlobe (снявшей поверхность Земли со спутников с разрешением 50 см), никогда не подвергались систематическому анализу. Если вдуматься, то такое несоответствие нашему обычно ненасытному желанию учиться и изучать шокирует. Для сравнения представьте себе ситуацию, при которой несколько поколений астрономов изучали бы далекие звезды, но не имели юридических прав смотреть на Солнце.
Тем не менее, зная, что на небе есть Солнце, мы не сможем побороть желание посмотреть на него. И поэтому в наши дни по всему миру происходит странный брачный танец. Исследователи и ученые обращаются к программистам, продукт-менеджерам и даже руководителям высшего звена корпораций за доступом к их данным. Бывает, первый этап переговоров проходит хорошо. Участники начинают встречаться за кофе. Так, слово за слово, через год на сцене появляется совершенно новый участник. И, к сожалению, чаще всего он оказывается юристом.
В попытках проанализировать имеющуюся у Google библиотеку всего мы были вынуждены найти способ для решения каждой из этих проблем. И должны признаться, что препятствия, связанные с цифровыми книгами, совсем не уникальны; по сути, они представляют собой всего лишь микрокосм, отражающий состояние больших данных в наши дни.