Вся технология в одной книге (Андреас Вайгенд) - читать бесплатно онлайн полную версию книги (Глава 1 Как научиться разбираться в данных Основной инструментарий цифрового гражданина) #5

Глава 1 Как научиться разбираться в данных Основной инструментарий цифрового гражданина

В XVIII веке грамотным считался человек, способный прочитать вслух знакомые ему куски из Библии или катехизиса; в наши дни человека, не умеющего большего, сочли бы функционально неграмотным – неспособным усвоить тексты, которые необходимы для экономического выживания[21].

Джордж Миллер

Как устроена обработка данных и какая именно информация о вас представляет ценность?

«Данные для людей» – не просто лозунг. В повседневной жизни мы постоянно сталкиваемся с информационными продуктами и услугами в виде рейтингов и рекомендаций, созданных на основе социальных данных. На смену традиционным рекламным деятелям пришли специалисты по обработке и анализу данных, которые пропускают через просчитанные алгоритмы несметные количества цифровых следов миллиардов людей. Изменения в ментальности имеют даже более важное значение, чем лавинообразный рост количества получаемой нами информации. Чтобы сделаться полноценным участником революции в использовании социальных данных, необходимо отбросить старые «потребительские» установки по принципу «бери, что дают» и переключиться на новое мышление – мышление активного созидателя социальных данных. Происходят сдвиги в балансах сил между продавцами и покупателями, банкирами и заемщиками, работодателями и работниками, докторами и пациентами, учителями и учениками. Информация о людях и от людей может и должна стать информацией для людей.

На самом деле нет ничего важнее запроса на информацию для людей. Социальные данные – самое ценное сырье XXI века, новая нефть[22]. Такая аналогия представляется вполне уместной по целому ряду причин. На протяжении более чем ста лет нашу экономику и общественно-политическую жизнь во многом определяли нефть и развитие технологий ее добычи, хранения и переработки в продукцию, потребляемую каждым жителем планеты. Сегодня возможность переработки персональных данных в продукты и услуги привносит в жизнь человечества изменения, сопоставимые с эффектом промышленной революции.

Нефть не используется в ее первичном состоянии. Ее нужно переработать в автомобильное горючее, пластмассы и многие другие продукты нефтехимии. В свою очередь нефтепереработка дала толчок развитию техники индустриальной эпохи и сыграла важную роль в производстве подавляющего большинства видов физической продукции современной экономики. Схожим образом и первичные персональные данные сами по себе являются достаточно бесполезными. Данные приобретают ценность в результате переработки – агрегирования, анализа, сравнения, фильтрации и дистрибуции новых информационных продуктов и сервисов. В отличие от продукции нефтепереработки, продукты переработки данных становятся основой не индустриальной революции, но революции социальных данных.

К счастью, информация как ресурс радикальным образом отличается от нефти. Запасы нефти на планете конечны, и по мере истощения этого ресурса его эксплуатация обходится все дороже. Количество же информации, напротив, растет в геометрической прогрессии, а стоимость технологий ее передачи и обработки неуклонно снижается. По состоянию на конец 2015 года смартфонами пользовались более половины совершеннолетних граждан[23]. Среднестатистический американец проводит в разговорах по мобильному телефону примерно два часа в день[24]. По существующим оценкам, в течение дня люди прикасаются к своим телефонам от двухсот до трехсот раз – едва ли не чаще, чем большинство из нас прикасается к своей партнерше за месяц[25]. Информация, в отличие от нефти, не иссякнет никогда.

Использование нефти ограничено факторами ее дефицита и вещной формы, а использование информации практически не ограничено, учитывая ее изобилие и цифровую форму. Конкретный объем сырой нефти может быть использован для переработки в готовую продукцию лишь единственным владельцем, тогда как одним и тем же информационным массивом могут одновременно пользоваться и превращать его в разнообразные продукты многие. В основе наших законов и социальных норм лежит идея дефицитности информации. Так, например, отсутствие информационного поля породило страхование как способ защиты от неприятностей и материальных потерь, связанных с чрезвычайными жизненными обстоятельствами. Поскольку возможность точно рассчитать вероятность заболевания диабетом или ограбления для каждого конкретного человека отсутствовала, страховщики делили людей на группы риска и устанавливали для каждой из них среднюю ставку страховых взносов. По мере роста объема информации мы сможем прогнозировать риск для каждого конкретного человека и индивидуализировать суммы страховых взносов. Можно делать вид, что данных не существует, но можно признать факт их наличия и задуматься над тем, как это может изменить нашу жизнь. Какой мир нам хотелось бы создать при помощи этого нового вида ресурсов?

Богатый потенциал возможностей новых технологий можно раскрыть при наличии соответствующих инструментов. До изобретения Гутенбергом печатного станка книг было мало, а доставка новостей жителям отдаленных местностей обходилась дорого. Большая часть населения не извлекала никакой выгоды от долгих часов, потраченных на обучение чтению. Профессор психологии Принстонского университета Джордж Миллер писал о современных стандартах грамотности еще до изобретения интернета. Его беспокоило, что слишком многие ученики не достигают в чтении, математических и научных дисциплинах того уровня навыков, которые необходимы для получения работы в экономике «интеллектуальных услуг»[26]. Я считаю, что сегодня налицо другая, не менее насущная потребность в грамотности нового типа – информационной. Она подразумевает понимание процесса переработки информации, знание изменяемых и неизменяемых параметров, умение интерпретировать ошибки и понимать возможные последствия передачи информации о себе. Для мира, где большую часть наших решений будут направлять рекомендации, полученные на основе обработки социальных данных, такая грамотность является обязательной.

Процесс переработки данных

Неудивительно, что одним из первых «инфоперерабатывающих заводов» стало предприятие розничной торговли – компания Amazon. Преуспевающий магазин обязан знать, какие товары, интересующие потенциальных покупателей, должны быть в наличии, а для этого нужно отслеживать данные о товарообороте, ценах, рекламе и потребительских предпочтениях своей целевой аудитории.

Двести лет назад практически вся информация, нужная хозяину магазина, заключалась в данных об остатках товара на полках и денег в кассе. По окончании каждого торгового дня эти данные вписывали чернильной ручкой в гроссбух. При выборе покупок из примерно одинакового ассортимента в одной и той же ценовой категории покупатель руководствовался информацией о надежности, привлекательностью упаковки или же мнением друзей, соседей и родственников. Примерно 150 лет назад несколько компаний, самыми известными из которых были Montgomery Ward и Sears & Roebuck Company, порадовали жителей провинциальных американских городков каталогами для заказа товаров почтой. Эти инноваторы своего времени знали, что именно обычно заказывает конкретный покупатель и куда ему доставляют товары, и поэтому могли определять уровень спроса на отдельные виды продукции в разрезе регионов. Сто лет назад, для того чтобы прогнозировать спрос и оптимизировать товарные запасы, компании, занимавшиеся торговлей по каталогам, открывали и шоурумы, и обычные магазины, а также держали целые армии аналитиков, прочесывавших статистику продаж[27]. Спустя еще пятьдесят лет в розничной торговле опять произошли важные перемены. С появлением системы почтовых индексов в США рассылочным фирмам и их торговым точкам стало проще отслеживать особенности своих потребителей[28]. В течение двух следующих десятилетий компании смогли собрать подробную демографическую информацию о людях, проживающих в различных географических областях. А вошедшие в обиход американцев с середины 1960-х годов кредитные карточки позволили собирать данные о покупках конкретного потребителя. До наступления эпохи интернета это был предел детализации личных данных – где человек живет и сколько и где он тратит.

Основанная в 1969 году компания-брокер данных Acxiom и ряд других вдоль и поперек анализировали данные домохозяйств, распределяя частных лиц по потребительским нишам, в которых фигурировали, например, сегменты «Образцово-показательных граждан», «Барских домов», «Селян с дробовиками» и «Пригородных наседок». И это еще не самые худшие образцы социальной стереотипизации[29]. В качестве источников информации у этих брокеров были только официальная статистика и отчетность о покупках по каталогам[30]. Например, узнать о том, сколько в данной местности имеется домов с бассейнами, можно было из кадастровой оценки недвижимости. Во времена, когда информации о потребителях было немного, маркетинговое сегментирование стало неслыханным прорывом. К началу нового тысячелетия годовая выручка Acxiom достигла почти миллиарда долларов[31].

Желание этих брокеров распространить свою аналитику и на интернет-торговлю было вполне естественным. За год до моего прихода в Amazon я работал с командой специалистов Acxiom над возможностью включения цифрового компонента в их базы данных, основанные на почтовых индексах и адресах домохозяйств. Менеджеры Acxiom пытались найти способ привязки нужного адреса электронной почты к уже имеющимся в базе данным о домохозяйстве. И пока Acxiom рассматривала возможность совершения одного небольшого шага, Amazon и остальные были уже на старте гигантского рывка к изобилию социальных данных. Я очень хорошо помню, как за шесть лет до появления первого айфона пытался объяснить менеджерам, что данные из онлайна в скором будущем позволят компаниям знать о домохозяйствах значительно больше. Торговля получит возможность отслеживать каждый поисковый запрос, каждый клик и каждую покупку, обращать внимание на каждую недооформленную «корзину покупок». Имея в своем распоряжении такой объем информации, компании смогут по-настоящему индивидуализировать маркетинг своих товаров и услуг, то есть ориентировать его на сегмент, состоящий из одного человека[32].

Из-за стремления торговать всем, что угодно, Amazon иногда называют «магазином всего», но, учитывая, насколько тщательно компания сохраняет каждый бит информации о своих клиентах и товарах, более правильным было бы называть ее «магазином, запоминающим все»[33]. В ассортименте предложений Amazon – сотни миллионов наименований, и поэтому она не может показать все, что в него входит. Пролистать весь ассортимент компании не получится в силу его масштаба. Компания не сможет показать вам что-то подходящее, пока вы не скажете ей, что именно вы ищете. Для того чтобы получить ранжированные результаты поиска, вам придется поделиться информацией. Варианта сохранить области своего интереса втайне от продавца у вас нет.

В 2002 году, когда я начал работать в Amazon, в числе прочих мы решали задачу перехода от анализа на уровне почтовых индексов к максимальному использованию всей информации о взаимодействии посетителей с сайтом. В итоге мы с командой определили пятьсот существенных признаков для каждого пользователя. А начиналась эта работа с того, что мы задались целым рядом вопросов, например: влияет ли расстояние между адресом доставки и ближайшим книжным магазином на то, как часто данный покупатель делает заказы в Amazon или на стоимость заказа? Можно ли прогнозировать покупательское поведение на основе типа его кредитной карты? Кто оставляет в Amazon больше денег за год – покупатели, делающие заказы в нескольких категориях, или те, кто заказывает только книги? Отличаются ли заказы какого-то конкретного покупателя, сделанные в утреннее время, от тех, которые он делает вечером? Результаты нашего анализа ложились в основу многих решений компании, например при выборе между затратами на рекламу и снижением цен на товары.

Этот анализ был полезен и для определения необходимого объема информации, которую посетитель должен предоставлять в ходе выбора покупок. Мы обнаружили, что на основе истории прошлых покупок можно с большей точностью прогнозировать вероятность покупок похожих видов продукции, а не одного конкретного продукта. Ассортиментные позиции связаны друг с другом по-разному, и просчитать эти связи можно различными способами. Судить о схожести товаров можно на основе сравнения спецификаций или анализа совпадений слов в описаниях, но самой важной информацией оказалось то, насколько часто две данные позиции просматривают или покупают вместе. Если можно было выявить тенденцию просмотра покупателями двух схожих позиций в течение одной сессии, их помечали как взаимозаменяемые. Когда покупатель рассматривал какую-то товарную позицию, ему предлагалось посмотреть на варианты ее заменителей («Какие другие товары покупают после просмотра этого?») и дополнений («С этим товаром часто покупают также»). Это делалось на основе анализа данных о прошлых запросах, просмотрах и покупках. Не менее полезными были и общие выводы о процессе принятия решений, которые можно было делать исходя из процентного соотношения просмотров и покупок конкретного товара.

Таким образом, система рекомендаций Amazon строилась на агрегированных данных просмотров и покупок. Кроме того, была создана платформа, позволяющая сторонним компаниям продавать свою продукцию на сайте с использованием складских мощностей Amazon, а это еще больше расширило область анализируемых данных. В отличие от рассылочных фирм с их «Пригородными наседками», «Селянами с дробовиками» и десятками прочих сегментов, Amazon могла прицельно обслуживать меняющиеся интересы и потребности каждого пользователя[34].

Само по себе сохранение информации не являлось чем-то революционным. Отличительной особенностью Amazon стало то, что компания обрабатывала информацию таким образом, чтобы помочь покупателю определиться с покупкой исходя из его же собственных интересов, вкусов и конкретной ситуации. Но излишняя персонализация может и отпугнуть потребителя. Журналист из «Нью-Йорк таймс» Чарлз Дахигг приводит отличный пример: на основе истории покупок одной молодой девушки сеть магазинов Target выслала на ее домашний адрес рекламное предложение продукции для будущих мам. Ее отец пришел в ярость, однако спустя пару дней дочь сообщила ему, что беременна. Алгоритмы Target не ошиблись[35].

ЕДИНСТВЕННОЕ,

НА ЧТО НЕ СПОСОБНЫ

НОВЫЕ ТЕХНОЛОГИИ, —

РЕШИТЬ, КАКОЕ БУДУЩЕЕ

МЫ ХОТИМ ДЛЯ СЕБЯ

И КАК ОТДЕЛЬНО ВЗЯТЫЕ

ЛИЧНОСТИ, И КАК

ОБЩЕСТВО В ЦЕЛОМ

Amazon изменила принципы маркетинга, начав использовать всю информацию, созданную в процессе взаимодействия пользователей с сайтом. Кроме того, у покупателей появилась возможность создавать информацию в виде отзывов о товарах. Этот эксперимент полностью перевернул традиционные представления о маркетинге с его стремлением к полному контролю над брендовыми коммуникациями. Покупатели охотно делились своим опытом и зачастую в большей степени полагались на отзывы других потребителей, чем на описания производителя или рекламу продавца. Если товар получал множество низких оценок пользователей, то положительные отзывы о нем экспертов или сотрудников уже не имели большого значения. Кроме того, публикация отзывов позволила значительно расширить представление потребителей об ассортименте «МагазинаВсего» и предоставила им возможность знакомства со всем спектром мнений. Со временем Amazon вообще отказалась от редакционного персонала и перенаправила ресурсы на разработку алгоритмов, позволяющих показывать наиболее полезные отзывы пользователей на самом видном месте страницы товара. Средства, затраченные на технологии обработки информации, помогли улучшить обслуживание покупателей в большей степени, чем затраты на отбор и рецензирование ассортимента.

Методика обработки данных в Amazon изменила поведение миллиарда покупателей. В 2015 году почти половина покупок в США начиналась с поиска и просмотра товара на Amazon, вне зависимости от того, где в конечном счете приобретался товар[36].

Для того чтобы управлять автомобилем, необязательно понимать все тонкости устройства двигателя внутреннего сгорания. Точно так же нет никакой необходимости досконально разбираться в алгоритмах Amazon, для того чтобы найти то, что нужно или представляет интерес. Важнее понимать базовые принципы устройства системы и установить правила ее безопасного использования. По мере того как информации создается все больше и она передается все более широкому кругу пользователей, мы можем либо занять пассивную позицию и предоставить право определять правила ее использования другим (беззаботно нажимая кнопку «соглашаюсь» после просмотра по диагонали двадцати с лишним страниц текста), либо принять активное участие в установлении новых норм взаимодействия. Можно относиться к переработке социальных данных как к таинственному «черному ящику», а можно стать информационно грамотными людьми, находящими разумные способы заставить тех, кто получает и обрабатывает наши данные, давать взамен не меньшие ценности.

Чего стоят ваши данные?

Уже сейчас при решении многих бытовых вопросов мы полагаемся на социальные данные – будь то выбор покупки на Amazon или места, где поужинать, и способа добраться до него. Социальные данные создаются в очень многих областях жизни, и постепенно мы попадаем во все большую зависимость от инфопереработчиков при принятии важнейших жизненных решений, в том числе выбора партнера для романтических отношений, места и условий работы, медикаментов и учебных заведений.

Во многих случаях истинное значение созданных нами данных становится понятным только в сравнении их с данными, созданными другими людьми. Поскольку объем социальных данных, доступных для инфопереработки, нарастает в геометрической прогрессии, сегодня можно надеяться на получение ответов на многие из вопросов, которые считались прежде не разрешимыми в принципе. Возможно даже, что это заставит задать ряд новых важных вопросов, которые раньше просто не приходили в голову.

Алгоритмы выявляют закономерности, которые люди не могут увидеть без помощи компьютеров. Эти закономерности могут помогать нам в принятии решений. Стоимость информации, предоставленной для переработки, определяется тем, насколько полезными окажутся полученные результаты для принятия нами решений – в коммерческих сделках, в приобретении товаров и услуг, в получении банковского кредита, в поиске работы, в получении медицинской помощи и образовательных услуг для себя и своих близких, а также в общественно-политической жизни.

Оценка степени полезности результатов деятельности компаний, работающих с данными, – это существенно иная постановка вопроса, нежели привычные рассуждения о том, как, когда и почему компании и государство собирают наш «цифровой выхлоп», то есть информацию, которую мы создаем изо дня в день. Некоторые считают, что объем собираемой информации слишком велик и что лучшим вариантом поведения для частного лица является поменьше рассказывать о себе или же требовать плату за создаваемые и предоставляемые личные данные. При такой сосредоточенности на входящем потоке информации мы упускаем из виду потенциальные выгоды, которые можно извлекать на выходе. Я считаю, что мы вправе требовать нечто намного более ценное, чем мелкая денежная подачка, за предоставление своих первичных данных. Мы должны настаивать на участии в управлении инфопереработкой на справедливых и понятных условиях, чтобы иметь возможность влиять на ее результаты.

Для начала давайте рассмотрим различия между первичной и переработанной информацией. Когда я ввожу в поисковую строку «Андреас Вайгенд», Google докладывает, что эти два слова обнаружены в «примерно в 122 000 результатов». Отсмотреть все эти страницы вручную невозможно: если на каждую тратить хотя бы пять секунд (феноменально высокая скорость просмотра), на это потребуется целая неделя, что совершенно нереально. Поэтому остается положиться на порядок выдачи результатов. Во главу списка Google может поставить самые свежие упоминания. Это будет прекрасно в случае, если я интересуюсь последними новостями о себе, но не так здорово, если я ищу видео семинара, который вел несколько лет назад. Другой вариант – посчитать, сколько раз мое имя упоминается на страничке, и ранжировать релевантность результатов в соответствии с наибольшим количеством таких упоминаний. Это может оказаться полезным, если я просматриваю статьи и хочу найти ту, где меня цитируют чаще, чем в остальных. Но представьте себе, что вместо своего имени я набрал в поисковой строке «айпад по дешевке» – это будет примерно 350 000 результатов, и над полезностью такой выдачи стоит задуматься. Специалисты по рекламным ловушкам наверняка поработали над страничками с популярными поисковыми запросами (что действительно так), и мне придется долго блуждать от результата к результату в поисках действительно полезной информации.

Чтобы повысить эффективность поиска, Google рассматривает полезность страницы с учетом многих характеристик, а не только наличия слов из запроса. Разработчики компании начинали с ранжирования релевантности страниц по принципу количества ссылок на них в других местах, что давало возможность судить об уровне внимания аудитории. Когда народ понял важность входящих ссылок для места странички в выдаче поисковика, появилась сфера деятельности под названием «поисковая оптимизация» с одиозными «фермами ссылок», или линкопомойками. Алгоритмы Google пришлось усовершенствовать, чтобы они могли отличать входящие ссылки реальных заинтересованных пользователей от созданных по заказу владельца сайта. Сегодня у Google помимо структуры ссылок сети есть накопленные за два десятилетия данные о том, на какие сайты, предложенные по поисковому запросу, заходили люди и сколько времени проводили на них, прежде чем вернуться к странице результатов поиска. Если на сайт заходят многие, но, лишь бегло взглянув на него, уходят искать что-то более интересное, релевантность страницы в поиске Google падает, и она опускается ниже в результатах поиска. Тем не менее высокое место странички в результатах поиска в Google не гарантирует достоверность представленной на ней информации, а является лишь свидетельством проявляемого к ней внимания.

Сколько поисковых запросов проходит через Google ежедневно? Сколько фотографий размещается в Facebook? Умение различать достоверные, недостоверные и невероятные данные – один из базовых навыков информационной грамотности. Точные цифры не столь важны: информационная грамотность означает умение видеть разницу между чем-то вполне приемлемым и явной ошибкой на порядок. В подобных оценках физики часто рассуждают с позиций порядковых величин, то есть десятикратных различий. Они скажут, что количество пользователей Google или Facebook составляет порядка миллиарда человек, поскольку оно точно больше 100 миллионов и меньше 10 миллиардов[37]. Далее они сделают допущение о том, что типичный пользователь делает в среднем 10 поисковых запросов в день, поскольку их точно больше одного, но меньше 100. При оценке количества фотографий в Facebook они будут исходить из показателя одно фото на пользователя в день, поскольку их точно больше, чем одно в месяц и меньше 10 в день. Таким образом, мы получаем порядковые оценки ежедневного количества поисковых запросов и размещаемых фотографий – 10 миллиардов и 1 миллиард соответственно. И это только два вида операций в области социальных данных[38].

Осознав, что социальные данные ежедневно создаются во многих миллиардах других случаев, вы начинаете понимать, что ваши собственные первичные данные не имеют какой-то особой ценности в материальном смысле. Умилительное фото вашей собачки, которое вы запостили в Facebook, заинтересует от силы сотню человек, или 0,00001 процента пользователей сайта. Практически полезные закономерности и взаимосвязи можно выявить, только собрав и проанализировав данные нескольких миллионов человек. Отсутствие в их числе данных какого-то одного человека не повлияет на выводы, сделанные в результате переработки остального массива информации. Картина инфопереработчиков не исказится из-за пропуска данных одного человека из миллиарда.

Более того, входящая информация не всегда бывает столь же дискретной, как размещенное в Facebook фото. Отдельно взятый элемент данных похож на камушек или даже песчинку в океане – он обладает индивидуальными чертами и его трудно найти. Или же он может напоминать каплю чернил, которая растворяется в воде до состояния полной неотделимости. Информационная грамотность подразумевает также понимание того, как может быть удалена ваша информация: нужно ли для этого совершать конкретное действие, или же она сама собой растворится в общей массе данных всех пользователей. Выше я писал о том, что в Amazon просмотр товара увязывается с просмотром другого товара или покупкой. Клиент может удалить факт любой покупки из своей истории заказов, если не хочет, чтобы она там фигурировала. Но удалить факт просмотров из системы рекомендаций Amazon невозможно, поскольку они не привязаны к конкретному пользователю. В этом случае можно вновь провести параллель с нефтепереработкой: на определенном этапе становится невозможным выделить нефть, полученную на какой-то конкретной скважине.

Такое понимание соотношения количества и качества данных отчасти – но не полностью – обосновывает мою убежденность в том, что требовать плату за предоставление личной информации было бы ошибочным. Одним из главных пропагандистов идеи платного предоставления данных является концептолог Microsoft Research Джарон Ланье. Он страстно отстаивает эту точку зрения с момента публикации своей книги «Кому принадлежит будущее?» в 2013 году[39][40]. Один из его любимых примеров – работа сервиса «Google-переводчик». Почему, задается вопросом автор, все доходы от рекламы получает Google, а всем тем, кто помогает совершенствовать алгоритмы компании, исправляя и дополняя варианты переводов, не достается ничего? Каждое исправление и дополнение, предлагаемое пользователями, улучшает систему переводов Google, даже если они являются повторами. Система как раз обращает особое внимание на неоднократно предлагаемые варианты.

Помощники Ланье получают компенсацию за свою работу. Весьма вероятно также и то, что они извлекают выгоду и от использования «Google-переводчик». Но в последнем случае это не деньги, а доступ к постоянно совершенствующимся информационным продуктам и сервисам.

Теперь давайте посмотрим, какая информация создается в Facebook. Автором информации, которую представляет собой фото вашей собаки, совершенно точно являетесь вы. А как быть в случае группового фото с вечеринки по случаю дня рождения? Вы сделали и разместили эту фотографию, но коммерческая ценность этого поста в Facebook определяется трафиком, который он создает, и уточнением данных о связях и интересах людей. Должны ли вы получить все средства, которые можно отнести на счет этого поста? Или вы должны разделить их со всеми, кто отмечен на этом фото? А как быть с комментариями, лайками и тэгами? Ведь они означают, что фото пробудило активность многих других людей, которая в свою очередь транслируется уже их друзьям. И эта информация о «цепочке» может быть намного более полезна с точки зрения возможностей обработки данных и извлечения из этого доходов. Ланье не обсуждает подобного рода связи, возможно, считая их недостаточно «креативным» контентом, за который стоит платить. Но такого рода цифровые следы составляют основную часть сырья инфопереработчиков, на результаты работы которых мы полагаемся в своей повседневной жизни.

Если заставить инфопереработчиков материально оценить вашу активность – все ваши поиски, просмотры, лайки и тэги во взаимосвязях со всеми, кто использует эти данные и дополняет их, можно с уверенностью предположить, что это они потребуют с вас плату за доступ к результатам поиска, рекомендациям и рейтингам. Разработка алгоритмов стоит денег, и подобный аналитический срез потребует создания специального инструментария для атрибуции и оценки каждого элемента данных, причем с учетом изменения его стоимости во времени.

Предложенная Ланье «микроплата» за предоставление данных – безнадежное мероприятие не только в силу сложности и затратности решения проблемы атрибуции. Для начала давайте просто посмотрим на порядок цифр. Если бы Facebook решила поделиться всей своей прибылью за 2015 год, составившей 3,5 миллиарда долларов[41], со своими пользователями (не выплачивая дивиденды акционерам), каждый из них получил бы примерно по 3 доллара 50 центов. Что для вас более важно – постоянно иметь в своем распоряжении платформу с неограниченными коммуникационными возможностями или одна лишняя чашка капучино в год? Если первое, то за ваши данные вам уже «заплатили».

Разбираемся дальше. Во многих случаях вам надо предоставить данные, чтобы получить услугу, например информацию о своем местоположении для приложения Uber. Решив, что впредь вы отказываетесь делиться своей информацией бесплатно, вы тем самым лишите себя возможности пользоваться бесплатными продуктами и услугами многих информационно-технологических компаний. Наконец, многие из продуктов этих компаний – от товарных рекомендаций до прогноза спроса на услуги такси – основаны исключительно на обработке первичных данных пользователей. И хотя конкретно ваши данные могут не иметь какого-то особого значения для конечного результата, сама просьба к потребителям продуктов и услуг предоставлять свою информацию является вполне уместной.

По этим причинам я полагаю, что, вместо того, чтобы настаивать на плате за свои первичные данные, следует потребовать предоставления более жесткого контроля над тем, как, когда и почему распространяется ваша информация, для чего она используется и что вы получаете в результате. Наиболее успешные инфопереработчики разъясняют, каким образом предоставляемые вами данные способствуют совершенствованию предлагаемых ими информационных продуктов. В обществе слишком много обсуждают ограничения, которые следует наложить на использование первичных данных организациями, но практически игнорируют вопрос о том, что инфопереработчики должны предлагать в качестве инструментов повышения прозрачности и расширения свободы выбора.

Переработка данных не превращает человека в товар в виде набора цифр, во всяком случае, это далеко не обязательно. Главное, что может почерпнуть из этой книги читатель, – это вывод о пользе обработки социальных данных для его собственных решений, а не только для рекламной кампании какой-нибудь мегакорпорации. Я считаю, что человека в равной степени определяют и создаваемая им информация, и принимаемые им решения. И ценность ваших данных для вас состоит именно в этом.

Исследование и использование

Процесс переработки данных подразумевает также компромисс между исследованием и использованием. Хочу перенести вас к рядам игральных автоматов в залитом неоновыми огнями Лас-Вегасе. В области искусственного интеллекта (то есть компьютерных программ, способных самообучаться на основе входящей информации) задача об «одноруком бандите» является в каком-то смысле коронной, примером дилеммы между поиском новых вариантов или использованием лучшего из известных[42]. Предположим, вы зашли в казино и узнали, что кто-то вроде бы выиграл целое состояние на одном из автоматов. Как вы поступите? Проведете остаток вечера у этого прославившегося автомата или же будете исследовать остальные в поисках еще более высоких шансов на джекпот? Разумеется, сбор данных о результативности всех автоматов потребует времени. Поскольку казино создаются ради прибыли, игры настроены так, чтобы клиенты в целом оставались в проигрыше. И в идеале, как учат теоретики вычислительных систем, вам придется в течение какого-то времени понаблюдать за работой автоматов, чтобы постараться обнаружить закономерность. И хотя статистик сможет порекомендовать, сколько времени нужно потратить на наблюдение за каждым из этих шумных устройств, у вас все равно останется выбор – или исследовать новые варианты, или использовать тот, который уже доказал свою результативность. Может показаться, что пример об «одноруком бандите» имеет мало общего с конечной продукцией инфопереработки, однако в списке рекомендаций для пользователей в качестве ключевой задачи значится как раз поддержание баланса между исследованием и использованием. Из этих соображений пользователь выбирает наиболее подходящую ему рекомендацию. И здесь аналогия с нефтью снова придется кстати. Геологи-нефтяники и инженеры оценивают альтернативу: стоит ли и дальше вкладывать значительные средства до полной выработки существующего месторождения или же переключиться на поиски новых, где добыча может обходиться не так дорого. Инфопереработчикам также приходится решать проблемы лучшего применения ресурсов для максимизации эффективности входящих и исходящих потоков данных. В том, что касается информации, главным параметром, который надлежит контролировать, является время пользователей.

Когда поисковик вроде Google выдает ответ на ваш запрос, перечень сайтов представляет не десятки одинаковых позиций, а предлагает различные варианты в рамках определенной степени релевантности предмету поиска. Иногда бывает понятно, что вам нужна информация о чем-то совершенно конкретном, например в случае, когда вы вводите в строку поиска словосочетание «Panthera onca». Но если вы введете в качестве предмета поиска просто «ягуар», то компьютер покажет вам не только то, что относится к представителю кошачьих, автомобилю или старой операционной системе компьютеров Mac[43]. Алгоритмы поисковой системы создают кластеры значений слова «ягуар» на основе количества слов на странице, связей между страницами и перемещениями пользователей между страницами и предлагают для изучения выборки из каждого такого кластера, чтобы обеспечить большую вероятность успеха вашего поиска.

Разновидностью задачи об «одноруком бандите» является задача «оптимального момента остановки», или «взыскательного ухажера». Впервые ее описал Мартин Гарднер в своей колонке «Математические игры» в журнале Scientific American. В его варианте на листках бумаги пишутся любые числа, «от мельчайших долей единицы до астрономически больших, вроде единицы со ста нулями»[44]. Листочки перетасовываются, а затем перебираются один за другим до тех пор, пока вы не останавливаетесь на том, где, как вы считаете, значится самое большое число. Со временем листочки бумаги в мысленном эксперименте превратились в ухажеров, идущих на свидание. Вы приходите на свидание, и вам надо решить: будете ли вы встречаться с остальными девушками или прекратите поиск, потому что это та самая? В реальной жизни выбор между исследованием и использованием может иметь критически важное значение.

< Назад Далее >