среда, 3 ноября 2010 г.

Введение в понятие Энтропия

Из Теории Информационных Технологий и Систем известно, что информационная энтропия - это мера хаотичности информации [1]. Другими словами, это неопределённость появления какого-либо символа первичного алфавита.
Если предположить, что при передаче информации отсутствуют какие-либо потери или шумы (все переданные символы и только они были получены приемником), то значение энтропии численно равно количеству информации на символ передаваемого сообщения.

Прекрасным примером служит любой язык, на котором говорят люди (во всяком случае, любой европейский язык. Утверждать что-либо об азиатских языках автору работы не позволяет недостаток опыта работы с ними, хотя в рамках предположения можно посчитать, что на языки этой группы в той же мере распространяются описанные ниже законы). Разные символы (буквы) встречаются в языке с разной частотой (ниже это будет доказано), более того - разные буквосочетания имеют разную частоту появления. Поэтому при добавлении новой буквы неопределенность получить следующую букву сообщения (слова) снижается.




В информатике большое месте занимает теория информации Шеннона и его подход к понятию энтропия. Если заглянуть в Википедию [2], можно узнать, что родился он в 1916 году в городе Петочки, Мичиган, США. Он закончил Мичиганский Университет и после этого долгое время работал в Массачусетском Технологическом Институте, где защитил степень доктора по математике и магистра по электротехнике. На сегодняшний день Шеннон известен как автор фундаментальных трудов по теории информации, электротехнике и криптографии. Мировую известность Шеннону принесла статья «Математическая теория связи», опубликованная в 1948 году. В ней Шеннон изложил свои идеи, ставшие впоследствии основой современных теорий и техник обработки передачи и хранения информации. Он ввел понятие информации, содержащейся в передаваемых сообщениях и первым начал рассматривать передаваемые сообщения и шумы в каналах связи с точки зрения статистики, рассматривая как конечные множества сообщений, так и непрерывные множества сообщений. Развитая Шенноном теория информации помогла решить главные проблемы, связанные с передачей сообщений, а именно: устранить избыточность передаваемых сообщений, произвести кодирование и передачу сообщений по каналам связи с шумами. 
Числовое значение энтропии и предел максимального сжатия данных устанавливается в теореме Шеннона об источнике шифрования. Эта теорема говорит о том, что минимальная средняя длина передаваемого слова (носителя информации, кодового слова) не может быть меньше, чем энтропия Шеннона, без потери точности информации. Другими словами, устанавливается предел максимального сжатия информации, до которого точность не теряется; и численное значение этого предела и есть значение энтропии Шеннона. Энтропия здесь представляет собой функцию от входного сообщения (случайная величина) и от размера алфавита, в котором происходит передача (или кодирование).
Можно проследить связь между количеством информации и энтропией. [3] Приведем ряд примеров. При бросании монеты выпадает орел или решка, это определенная информация о результатах бросания. При бросании кубика мы получаем информацию о выпадении определенного количества очков. В каким из этих двух случаев мы получаем больше информации?
Известно, что вероятность W выпадения орла равна 1/2, вероятность выпадения трех очков на кости - W=1/6. Реализация менее вероятного события дает больше информации: чем больше неопределенность до получения сообщения о событии (бросание монеты, кости), тем большее количество информации поступает при получении сообщения. Информация I связана с числом равновероятных возможностей P - для монеты P=2, для кости P=6. При бросании двух костей мы получаем вдвое больше информации, чем при бросании одной кости: информация независимых сообщений аддитивна, а числа равновероятных возможностей перемножаются. Значит, если имеются два набора равновероятных событий P1 и P2 , то полное число событий
P=P1*P2, (1)
а количество информации I складывается, т. е.

I(P)=I(P1*P2)=I(P1)+ I(P2).    (2)
Известно, что правилам (1) и (2) подчиняются логарифмические функции, т. е. зависимость количества информации I от числа равновероятных событий должна иметь вид
I=A*log(P)
где постоянная А и основание логарифма могут быть выбраны по соглашению. В теории информации условились полагать А=1, а основание логарифма двум, т. е.
I=log2(P). (3)
При бросании монеты получается информация (Р=2), которую примем за единицу информации I=1:
log2(2)=1 бит
В общем виде формула (3) принимает вид (вывод опускается)[3]:

Такая величина (4) названа Шенноном информационной энтропией.
В начале работы была постулирована идея о том, что различные буквы встречаются в языке с разными вероятностями. Для того, чтобы подтвердить или опровергнуть данное утверждение, можно провести небольшое исследование: возьмем достаточно большой набор слов русского языка и подсчитаем вероятности появления различных символов. В качестве источника слов возьмем "Толковый словарь русского языка в 4-х т." - всего 86702 слова. Чтобы обработать этот объем информации воспользуемся утилитой, написанной автором этой работы на первом курсе обучения в ГУ-ВШЭ.
 
Утилита была создана в том числе для подсчета вероятностей встречи различных символов в тексте и расчета энтропии. Проведем это с выбранным словарем. Результаты показаны на рисунках 1 и 2.
 

Рисунок 1. Результаты анализа толкового словаря
 

Рисунок 2. Результаты анализа толкового словаря (продолжение)
 
Как видно из результатов, наименьшая вероятность встретить знак "Ъ", наибольшая - буквы "А", "В", "Е", "Н" "О", "Р", "С", "Т". Интересное наблюдение: расположение букв на клавиатуре таково, что наиболее часто встречающиеся буквы находятся в центре (можно посмотреть на полученный ряд и центр клавиатуры), а самые популярные "А" и "О" отмечены точками для расположения указательных пальцев. Английская же раскладка организована по другому принципу - самые популярные буквы расположены на удалении друг от друга, что диктовалось технологией реализации первых клавиатур печатных машинок и со временем так укоренилось в обществе, что нынче проект перевода общества на более эргономичную клавиатуру сопряжен с невероятно большими издержками, что делает его невыполнимым (в литературе такая ситуация получила название "QWERTY"-эффект).
Для наглядности распределения вероятностей средствами утилиты можно построить диаграмму (см. рис. 3).
 

Рисунок 3. Диаграмма соотношения вероятностей появления различных символов
 
Наиболее крупные ячейки и есть самые часто встречаемые символы.
Однако, можно предположить, что в разных профессиональных средах это распределение нарушается и изменяется. Для сравнения возьмем два крупных текста: отрывок художественного произведения и отрывок деловой прозы (технического текста).
В качестве художественного произведения взят отрывок в первые 2700 слов "Анны Карениной". Для чистоты эксперимента из текста были удалены все знаки препинания.
 

Рисунок 4. Вероятности появления символов и энтропия для художественного текста.
В качестве примера технического текста взята инструкция по эксплуатация герметизированных свинцово-кислотных аккумуляторов с регулирующими клапанами (2700 слов). Для чистоты эксперимента из текста так же были удалены все знаки препинания.
 

Рисунок 5. Вероятности появления символов и энтропия для технического текста.
 
Как видно, распределение вероятностей в целом не изменилось, хотя конкретные значения несильно исказились. В целом мера неопределенности несильно выросла, что можно объяснить, например, большим использованием специфических терминов, в которых используются редкие для художественной речи сочетания букв.
Выше были подсчитаны вероятности встретить каждую букву при случайном выборе одной буквы из массива связного текста. Однако интересно, изменяются ли эти вероятности внутри одного слова? Если мы случайным образом выберем первую букву, то будет ли распределение вероятностей при выявлении следующей буквы такой же, как и при выборе первой буквы?
Можно провести мысленный эксперимент. Вероятность, что первой попавшейся буквой будет "О", достаточно велика, в то время, как вероятность выбрать "Ь" очень мала, но она есть. Пусть первой буквой в слове попалась "О". Поскольку в русском языке не встречаются буквосочетания "ОЬ", то вероятность встретить следующей буквой "Ь" станет не та, малая, что была раньше, а ноль. Поэтому можно сделать вывод, что вероятности при последующей встрече букв в рамках одного слова будут отличаться от вероятностей встретить эти буквы в качестве первых. Следовательно, неопределенность падает и каждая последующая буква несет меньшее количество информации, чем предыдущая.
 
К сожалению, доступных автору технических средств недостаточно для подсчета энтропии связного текста, имея слова как атомарные единицы. Это обуславливается в первую очередь сложностью обработки слов русского языка, связанной со сложноформализуемым алгоритмом образования разных форм одного и того же слова. Однако, можно предположить, что те же выкладки характерны и в этой ситуации:
Пусть каждое слово есть атомарный (в рамках текста) источник информации, тогда текст есть совокупность этих источников, несущая общий смысл (сообщение). Так, к связному тексту, состоящему из слов, применимы те же понятия, что и к любому коду, среди них и понятие энтропии. Точно так же вероятность встретить каждое новое слово в рамках одного связного предложения изменяется при наличии ранее выбранных слов, а степень неопределенности уменьшается при появлении каждого нового слова.
В ходе работы были получены следующие результаты:
было получено определение понятия энтропии - это мера хаотичности информации, или неопределённость появления какого-либо символа первичного алфавита.
было введено понятие информационной энтропии Шеннона.
были подсчитаны вероятности появления различных символов в текстах разного рода - словарь (список существительных), художественный текст, технический текст. Был подсчитан показатель энтропии и сделаны выводы по изменению вероятностей появления символов в зависимости от расположения буквы в слове.
была высказана идея о вероятной идентичности поведения слов внутри связных текстов поведению букв внутри слов языка.



Список использованных источников информации

1. Кирсанов А.П. Теория информационных технологий и систем. Курс лекций, ГУ-ВШЭ, 2007
2. http://ru.wikipedia.org/wiki/Шеннон,_Клод_Эдвуд , дата обращения 21.09.2010
3. Дульнев Г.Н., Ипатов А.П., Агеев И.Л. Электронный учебник по дисциплине: "Синергетика". http://de.ifmo.ru/bk_netra/page.php?tutindex=13 - дата обращения 21.09.2010
4. Толковый словарь русского языка: В 4 т. - М.: Сов. энцикл.: ОГИЗ - http://feb-web.ru/feb/ushakov/ush-abc/11/us1146515.htm - дата обращения 21.09.2010 


вторник, 2 ноября 2010 г.

Сборище нелепостей

Сегодня только ленивые не собирают смешные нелепости, которые они встречают на улицах, на работе, в интернете. Результаты общей работы оседают на страницах блогов и развлекательных сайтов, аккумулируются на ресурсах а-ля Идиотека Лебедева или на выступлениях Задорнова. Под катом внесу свои пять копеек

Самое первое, что следует за нами везде и всегда - опечатки. Они окружают нас повсюду: в рекламе, в объявлениях. Например, вот маршрутка номер 99м: "м. Сокол- м. Крылатское". Одна из остановок носит гордое название "М-Видио".
(названия остановок в маршрутке 99м)

Подобных примеров в жизни очень много, выложу несколько наиболее ярких. На следующей фотографии не очень видно, кто-то уже наверное пытался исправить все подручными средствами, но этой вот компании требуются "Распрастронители":

(рекламное объявление в автобусе)

А вот тут тоже зовут не куда-нибудь, а "собиседоваться". 
(ТЦ "Кочубей")

Дальше - самое любимое. Не знаю почему, но, увидев, очень долго смеялся:
(Белорусский вокзал, ларек с сувенирами)

Последним в данной линейке выступит один из флагманов тяжелого машиностроения ФРГ, минный заградитель "Скарпион":
(воинская часть 58142: 45 инженерно-маскировочный полк,
стенд в учебном корпусе)


К сожалению или к счастью, опечатками окружающая нас действительность не ограничивается. Очень многие люди проявляют свои смекалку и стремление к самореализации на улицах. Иногда получается забавно, иногда - меньше. Такой вот плакат встречал людей на выходе из метро Сокол пару месяцев назад:
(рядом с м. Сокол)

А вот такое объявление висело в подъезде некоего дома в Москве.
(подъезд жилого дома)

К той же серии - довольно часто встречаются на улице "капитанизмы". Очень яркий пример:
(СК "Олимпийский")

Вдвойне забавно, когда в изначально креативной сфере возникает переизбыток этого самого креатива, выливающийся в порой довольно забавные вещи. Я говорю о наружной рекламе. Если верить вот этому плакату, то все, что нужно женщине...
(ВДНХ)

... это мед и медовуха. Не поспоришь. Вот такое объявление в маршрутке меня тоже воодушевило до глубины души:
(одна из городских марштурок)

Вообще тема маршрутных такси практически неисчерпаема. Погуглив, можно найти миллионы забавных плакатов и объявлений в них. Поэтому забудем о них и пойдем дальше. Раньше я думал, что жизнь обидела людей с именами Параша, Даблин или Гигант. Но такое... :
(афиша в городе)

 А вот такой фитнес-зал находится в поселке Дубки, что в Подмосковье:
(пос. Дубки)

Отдельно забавно выглядят вещи, направленные на одну аудиторию и попавшие в другую. Примерами служат специальные профессиональные вывески и знаки:
(один из магазинов города)

объявления без контекста:
(городская поликлиника 199)

и абсолютно нормальные плакаты, обработанные сквозь призму испорченного интернетом мозга:
(боян всея Руси. афиша на стенде)


Отдельно мне в свое время очень понравилась такая вот новогодняя игрушка. Так и вижу: куча маленьких сатанистиков кричат "Купи! Купи!":
(Новогодняя игрушка. ТД "Детский мир")

Напоследок просто часы, которые показывают полдесятого. Ровно.
(часы на улице. Крылатское)

среда, 20 октября 2010 г.

Я - система

Всегда трудно начинать письменные работы, особенно если предполагается, что они должны быть выполнены в формате эссе. Более формализованные виды работ имеют набор штампов, с помощью которых можно ввести читателя в предметную область и плавно перейти к сути. Здесь их применение не уместно, и сделать такой переход гораздо сложнее. Казалось бы, что стоит оформить поток мыслей в письменную форму и назвать емким словом "эссе"? Пока те самые мысли находятся в голове, они подвержены метаморфозам, могут свободно перетекать одна в другую, остаются понятными нам, даже если мы что-то себе недоговариваем или опускаем часть фактов. Такой подвижный, изменчивый и расширяющийся поток идей выстраивается в голове в четкую, логичную последовательность, которую и хочется донести до читателя. Однако, стоит только начать переносить эту последовательность на бумагу (пусть и электронную), как строй сбивается, логика оказывается нарушенной, общая нить куда-то пропадает. Поэтому в результате такой работы очень часто получается совершенно не такой текст, который родился в голове у автора в момент создания.

Так получилось и сейчас, с темой "Я - система". Первая моя мысль была: начать с объяснения того, что такое система, а затем плавно показать, что все ее признаки выполняются и во мне самом. Но удивительное дело, стоит только выписать перед глазами список каких-то формальных требований (в данном случае - признаков системы), как автоматически перестраиваешься и начинаешь "подгонять факты", т.е. выискивать порой даже суррогатные подтверждения того, что подтвердить надо. Поэтому с намеченного заранее пути пришлось свернуть примерно на половине и пойти с обратной стороны. А именно начать с осознания того, что же такое "я".

Если обратиться к философскому словарю, то "Я - фундаментальная категория философских концепций личности, выражающая рефлексивно осознанную самотождественность индивида". Определение сложное, но осмыслить его вполне реально. Т.е. получается, что "я" - это то, как человек сам себя вопринимает, то, чем он считает сам себя. Но вот что интересно: существует множество наук по изучению человека, которые смотрят на него с совершенно разных точек зрения. Самое первое, что приходит на ум - биология. Много веков изучалось человеческое тело, из чего оно состоит, какие в нем органы, как они взаимодействуют друг с другом, какие процессы там протекают. Благодаря школьномым урокам почти все мы сегодня представляем, как мы там внутри устроены. Но возникает вопрос - а где вот в этом вот во всем я? Ведь "я" - это очевидно не только тело. Оттуда "я" получает только сигналы, причем императивного характера: тело отправило сигнал - "я" пошло выполнять. В спектакле Е. Гришковца "Одновременно" герой задется аналогичным вопросом и предлагает такой ответ: "Наверное, я в голове". Логично же, мы видим мир как бы из нее, относительно нее воспринимаем наше тело; это место обработки всех эмоций, переживаний, там работает воображение. Можно предположить, что "я" - это наш живущий в голове разум. Но следущий пример, взятый из того же спектакля, рушит это предположение:
Идет фильм, и главную роль играет актриса, которая кажется мне знакомой. Я говорю смотрящим со мной друзьям: "Это хорошая актриса, только вот как ее зовут я не помню. Да и где она играла не припомню никак...". И идет фильм, а я его уже не смотрю - я судорожно пытаюсь вспомнить, где же я ее видел. Как же ее зовут. И фильм прошел мимо, и вспомнить не удалось. А потом, через неделю или две, просыпаюсь среди ночи и - вспомнил! Вспомнил и как звали актрису, и где она играла. Только вот уже не понятно, а зачем вспоминал? Не будешь же звонить среди ночи друзьям и говорить про нее.  Да и мне эта информация не нужна.
Получается, что даже если и кажется, что "я" - это где-то там, в разуме, то на самом деле это не совсем так, иначе почему же голова не всегда работает так, как нам надо, не всегда получается достать из нее те воспоминания, которые нам нужны (хотя мы знаем, и это факт, что они там точно есть). Другая дисциплина, в некотором роде диаметрально противоположенная предыдущей, говорит нам, что "я" - это душа, а тело всего лишь временная ее оболочка, в то время как душа бессмертна и живет вечно, меняя такие оболочки. Но из определения, данного в начале работы, следует, что если человек не осознает себя как свою душу, то ее нельзя назвать своим "я". Действительно, трудно отождествлять себя единственно с тем, что мы не можем осязать и к чьей памяти мы не можем обратиться.
Если подвести промежуточный итог, то "я" - это не единственное тело, не единственный разум и не единственная душа, но частично каждое из них. На правах автора работы на данном этапе предлагаю взять небольшую паузу и перейти ко второй части темы эссе, а сюда вернуться чуть-чуть позже.

Система, ссылаясь на курс лекций по "Теории систем и системному анализу", - это совокупность элементов, находящихся во взаимодействии. Существенное здесь то, что элементы должны быть взаимозависимыми и/или взаимодействующими. Различные объекты можно семантически объединить в единое целое, но это целое еще не система, пока не сформирован, например, некоторый механизм. В чем разница между механизмом и набором деталей? В том, что механизм имеет некоторую функцию, которую он выполняет. Перефразируя, можно сказать, что механизм имеет цель. Именно наличие цели и является одним из основных признаков того, что перед нами система. В свою очередь, любая система может являться частью более крупной системы (надсистемы) или быть разбита на более мелкие (подсистемы). Возникает резонный вопрос, как определить границы системы. Ответ на этот вопрос заложен в целях и задачах проводимого анализа. Джон О'Шонесси в книге "Принципы организации управления фирмой" приводит такой пример:
Возьмем, например, проектирование такой машины, как токарный станок. Если считать сам станок системой, то в этом случае недостаточное внимание обращается на физические ограничения человека-оператора. Эргономисты сегодня говорят о 'человеко-машинной' системе, подчеркивая этим, что зачастую человек и машина образуют единую систему; следовательно, отдельные части станка, такие, как рукоятки и циферблаты, должны проектироваться с учетом физиологии человека.
При идентификации и анализе систем специалисты опираются на ряд критериев, называемых свойствами системы. Здесь стоит вспомнить, как ранее, при определении понятия "я" было выделено несколько основных компонент, никакой из которых нельзя назвать отождествлением "я" в чистом виде. Попробуем предположить, что "я" спрятано в совокупности этих составных частей, находящихся в тесном взаимодействии (по определению - системе). Теперь проверим это предположение, опираясь на свойства системы, и посмотрим, выполняются ли они. Сначала проверим ряд критериев, связанных со взаимодействием с окружающей средой:
  1. Коммуникативность — существование сложной системы коммуникаций со средой. 
  2. Взаимодействие и взаимозависимость системы и внешней среды.
  3. Адаптивность — стремление к состоянию устойчивого равновесия, которое предполагает адаптацию параметров системы к изменяющимся параметрам внешней среды (однако «неустойчивость» не во всех случаях является дисфункциональной для системы, она может выступать и в качестве условия динамического развития).
  4. Надёжность — функционирование системы при выходе из строя одной из её компонент.
Как видно, наше "я" через свое тело отвечает всем этим компонентам. Организм обеспечивает обмен веществами с внешней средой, подстраивается под изменения параметров (перепады давления, температуры и т.д.), продолжает функционировать при травмах. При этом, если перестает работать более глобальная компонента, например, всё тело, то система в целом ("я") не распадается. Например, парализованные люди не теряют своего "я" из-за болезни.
Следующий ряд критериев к проверке связан со структурой и функциями системы. Первые два критерия были уже не раз доказаны в ходе этого эссе: Структурность и Иерархичность. Эти критерии говорят, что возможна декомпозиция системы на компоненты и установление связей между ними, при этом каждый компонент может быть рассмотрен как система. Именно на основе этих двух свойств систем были объеденены в предположении выше три ранее описанных компоненты в одно целое. Теперь очевидно, что такое объеднение вполне правомерно в рамках системного анализа.
Как было сказано выше, система обязана иметь цель. Стоит добавить, что при этом наличествует приоритет интересов системы более широкого (глобального) уровня перед интересами её компонентов. Приведем такой пример: когда человек занят каким-то делом, он может ограничивать себя в еде, отдыхе и сне для достижения ее. Таким образом интересы этого человека в целом - выполнение работы - оказываются приоритетнее чем насущные потребности его частей.

До сих пор, во время применения критериев систем к понятию "я", был сознательно опущен тот факт, что "я", на самом деле, не сводится к тем выделенным подсистемам. Может показаться, что это означает, что что-то упущенно, какой-то новый компонент, в котором это самое "я" и хранится. На самом деле это не так, вернее не обязательно так. Теория систем говорит, что любая система характеризуется эмерджентностью, т.е. целостностью и неаддитивностью. Говоря простым языком, целое первично относительно частей, следовательно система может обладать новым качеством, органично вытекающим из составных элементов, но не принадлежащим ни одному из них. Другими словами, свойства системы принципиально не сводимы к сумме свойств составляющих её компонентов.
Таким образом, применяя системный подход к определению понятия "я", можно сделать вывод, что "я" полностью попадает под определение системы. Существует множество классификаций систем по характерным особенностям, таким как динамичность, естественность, качественный состав компонентов и т.д. При желании не сложно выделить, к каким типам систем относится понятие "я" и на вопрос "Что такое я?" вполне можно отвечать такой фразой:


"Я" - это биологическая (живая) абстрактно-материальная (состаящая из материальных и нематериальных частей) открытая (взаимодействующая с внешней средой) динамическая система.

воскресенье, 20 июня 2010 г.

Issac Albeniz - Asturias

пятница, 18 июня 2010 г.

Планирование рекламных кампаний в Интернет

Планирование проведения рекламных кампаний (РК) в Интернет - процесс комплексный, состоящий из двух составных частей:
  1. Определение таргетингов
  2. Распределение показов
Первый из них, определение настроек таргетинга, подразумевает выбор из всех возможных рекламных площадок в Интернет тех, на которых рекламодатель хотел бы показывать рекламу (таргетинг по площадкам), а так же выделение из всей аудитории той, которой эта реклама адресована. Такое выделение возможно несколькими способами: по географическому размещению пользователей (геотаргетинг), по юзер-агентам пользователей, по регистрационным данным пользователей (демотаргетинг), и т.д.

Задача же непосредственного распределения показов по выбранным площадкам представляет собой выбор оптимального числа показов на каждой из них. Под оптимальностью здесь понимается максимальная отдача от рекламы, измеряемая, например, количеством кликов по баннерам. В простейшем случае рекламодатель ограничен своим бюджетом и трафиком сайтов-площадок, при этом он максимизирует количество кликов. Формально такую ситуацию можно представить следующим образом:

              трафик    стоимость   средний ctr*
Сайт1:       t1            p1                c1
Сайт2:       t1            p2                c2
Бюджет РК: $B

, где Сайт1 и Сайт2 - рекламные площадки в Интернет,
трафик - суточный трафик площадки,
средний ctr - средний показатель ctr по площадке (ctr - click-though-rate - показатель эффективности Интернет-рекламы, измеряемый как отношение числа кликов по баннеру к числу показов баннера),
пересечения строк и столбцов - значение показателя для конкретного сайта.

В математическом выражении эти ограничения выглядят так:
Пусть xi - количество показов рекламы на конкретном сайте, тогда:
бюджетное ограничение: p1*x1+p2*x2 <= B              (1)
ограничение по трафику: x1 <= t1 ; x2 <= t2              (2)
условие неотрицательности: x1, x2 >= 0              (3)
Целевая функция: c1*x1 + c2*x2 -> max              (4)

В простейшем случае с двумя рекламными площадками и таким набором ограничений задача решается в течение пары минут. Однако, в жизни все как правило несколько сложнее. Первое, что усложняет ситуацию - обратный таргетинг (использование слайсов). Слайс - это некоторый процент трафика площадки, который та выделяет под конкретного рекламодателя. Например, в нашем случае это:
Сайт1: s1
Сайт2: s2
Тогда ограниения по трафику (2) должны изменяться на эти показатели:
 x1 <= t1*s1 ; x2 <= t2*s2              (5)
В остальном схема та же.

Более интересный случай, при котором каждый сайт предлагает разные условия в разное время или целевая аудитория неравномерно распределена по суткам, что вытекает в разные значения ctr для разных временных интервалов. В таком случае каждый временной интервал для каждого сайта можно рассматривать как отдельную площадку со своими условиями, например:
Сайт1: утро: c1 вечер c'1
Сайт2: утро: c2 вечер c'2
Тогда формально задача сводится к такой:
Пусть x1 - количество показов на площадке 1 утром, x'1 - вечером, а x2 - количество показов на второй площадке утром, x'2 - вечером, тогда:

бюджетное ограничение: p1*(x1+x'1)+p2*(x2+x'2) <= B                        (6)
ограничение по трафику: (x1+x'1) <= t1*s1 ; (x2+x'2) <= t2*s2              (7)
условие неотрицательности: x1, x2, x'1, x'2>= 0                                      (8)
Целевая функция: c1*x1 + c2*x2 + c'1*x'1 + c'2*x'2 -> max                   (9)

В общем виде такого рода задачи можно представить как:  (10)
P*∑Xj <= B
∑Xj <= T*S
Xij >=0
∑∑(Cij*Xij) -> max
, где P - вектор цен сайтов
T - вектор трафиков сайтов
S - вектор слайсов сайтов
Cij - ctr i-того сайта в j-ый период
Xij - количество показов на i-ом сайте в j-ый период
∑Xj - вектор суммарных количеств показов для каждого сайта за все периоды


Такого рода задачи решаются с помощью методов линейного программирования, а именно, из вида (10) приведенные к стандартной форме решаются симплекс методом. Сущность метода здесь описывать не буду. Более простые ситуации (с малым количеством переменных) можно решить графически. В конце будут приведены примеры решения такого рода задач.

Таким способом можно решать задачи различного рода, оперирующие теми же понятиями. Например, перед компанией стоит другая задача: достигнуть определенного числа кликов за минимальные деньги. Тогда в формальном представлении задача сводится к такой (11):

∑∑(Cij*Xij) = K
∑Xj <= T*S
Xij >=0
P*∑Xj -> min

, где условие бюджетного ограничения перетекло в целевую функцию, которая должна быть минимизирована, в то время как целевая функция перешла в новое ограничение: сумма всех кликов (ctr*показы) должна равняться определенному значению K.

Использование симплекс-метода в решении задач планирования РК имеет ряд преимуществ:

  1. Гарантированное нахождение оптимального решения в заданных рамках (если оно существует)
  2. Возможность использования результатов предыдущих вычислений ответа с целью анализа изменений
Второй пункт стоит пояснить. Линейное программирование предоставляет инструмент учета устойчивости решения, с помощью которого можно прогнозировать изменение оптимального решения в ответ на те или иные изменения окружения задачи (изменения ограничений или целевой функции). Примерами таких изменений могут послужить колебания ctr сайтов, изменения цен или величины бюджета.

Пример1.
Пусть даны такие начальные условия:
                       трафик    стоимость   средний ctr*
Сайт1:       1000            1                0,2
Сайт2:       2000            2                0,1
Бюджет РК: $1000
Тогда ограничения:
бюджетное: x1+2*x2 <= 1000
на трафик: x1 <= 1000 ; x2 <= 2000
целевая функция: 0,2*x1 + 0,1*x2 -> max

Строим график:

Линия А-В - бюджетное ограничение, рассматрвиаем только положительную область, т.к. работаем с натуральными показателями. Выделенная область - область допустимых значений x1 и x2. Ограниченя на трафик не изменяют выделенной области. Кол-во кликов растет вдоль вектора grad = (2, 1) (градиент целевой функции), отсюда следует вывод об оптимальности точки B, т.е. все показы совершаются на сайте 1. Логично, что при отсутствии лимитирующих ограничений на трафик, ниболее выгодно все показы совершать на том сайте, где выгоднее отношение ctr к цене. Другая ситуация рассмотрена в примере 2.
Пример2
Добавим в предыдущий пример ограничение на слайсы. Пусть первый сайт выделяет 50% трафика, а второй - 95%. Тогда ограничения изменятся следующим образом:
бюджетное: x1+2*x2 <= 1000
на трафик: x1 <= 1000*0,5 ; x2 <= 2000*0,95
целевая функция: 0,2*x1 + 0,1*x2 -> max

В этом случае ограничения на трафик меняют допустимое множество решений, и в оптимуме мы переходим в точку С.

воскресенье, 6 июня 2010 г.

Процесс анализа информационных рисков

В рамках подготовки к защите диплома...

На сегодняшний день многие компании в своей деятельности используют различные достижения сферы информационных технологий для получения конкурентных преимуществ. Однако, использование любого нового инструмента, в том числе и ИТ, влечет за собой добровольное принятие новых, связных с этим инструментом, рисков, угрожающих непрерывности бизнеса. Таким образом становится актуальным умение управлять такими рисками.
Отсюда вытекает основная цель данной работы:"Создание аналитической основы системы управления информационными рисками." Для ее достижения необходимо решить следующие задачи:
  1. Определить понятие «информационный риск»
  2. Определить и формализовать процесс анализа информационных рисков
  3. Разработать способ сбора и хранения результатов анализа, отвечающего требованиям системы управления рисками
Многие ученые сходятся во мнении, что термин "риск" обозначает принятие решения, результат которого заранее неизвестен. Риск имеет отношение только к будущему и неразрывно связан с принятием решений. Можно сказать, что риск всегда обозначает вероятностный характер исхода, причем вероятность бывает двух типов. Первый тип - объективная - связан с природой вещей и материи, в то время как второй - субъективная - связан с недостатком информации у лица, принимающего решения. Здесь следует разграничить два понятия: риск и неопределенность. На сегодняшний день существует два основных подхода к такого рода разграничению. 

Информационный подход основывается на представлении о том, что различия между риском и неопределенностью сводятся к объему доступной информации об исследуемой ситуации. Риск характеризуется как «измеримая неопределенность», а непосредственно неопределенность – «неизмеримая определенность». Оценочный подход базируется на представлении о том, что различия между риском и неопределенностью заключаются в субъективном отношении к реализации того или иного исхода, а именно риск связан с отношением к неблагоприятным исходам, а неопределенность связана с многовариантностью будущего развития, т.е. с неоднозначностью исхода. Подводя итог, можно сказать, что неопределенность объективна по природе, она порождает риски, которые субъективны по природе.

Поняв, что же такое риск в целом, можно перейти к основной теме работы: рискам информационным. На сегодняшний день существует множество определений данного понятия, однако, далеко не все охватывают все грани термина. Некоторые определения рассматривают только риски систем, некоторые не принимают во внимание угрозы интеллектуальной собственности. Наиболее функционально полное определение должно охватывать все области воздействия такого рода рисков, а именно: Информационные технологии (Сети, ПО, Аппаратное обеспечение etc.), Поддержка принятия решений (СППР, Стандартизация, Совместимость etc.), Интеллектуальная собственность (Нематериальные активы, Учет и отчетность etc.). Примером такого определения может являться: "Возможность наступления случайного события, приводящего к нарушениям функционирования и снижению качества информации в информационной системе предприятия, а также к неправомерному использованию или распространению информации во внешней среде, в результате которых наносится ущерб предприятию"

Для того, чтобы правильно управлять такого рода рисками, в первую очередь необходимо уметь их определять и анализировать. Процесс анализа информационных рисков состоит из четырех основных этапов.

Первый этап: Идентификация и группирование информационных ресурсов. На данном этапе составляется список информационных ресурсов предприятия, они группируются по классам. Для каждого ресурса выявляется его критичность, например одна из трех:
  • критические ресурсы – организация или подразделение не могут продолжать свою деятельность без данных ресурсов;
  • основные ресурсы - организация или подразделение могут продолжать свою деятельность, но очень ограниченное время , и ресурсы должны быть обязательно восстановлены;
  • нормальные ресурсы - организация или подразделение могут продолжать свою деятельность длительный период времени, но некоторые пользователи будут частично ущемлены.
Таким образом, на данном этапе составляется макет информационной инфраструктуры предприятия.

Следующий этап: Идентификация и измерение рисков. Под идентификацией здесь понимается выбор из списка общих рисков, свойственных информационным технологиям, тех, которые являются относящимися к текущей инфраструктуре. В качестве общего списка (отправной точки) можно взять, например, список, предложенный немецким стандартом информационной безопасности BSI - IT Baseline Protection Manual. Измерение же рисков можно осуществить по следующей схеме:
МЕРА РИСКА = P(происшествия) * Величина потерь
, где первый множитель - вероятность наступления рискового события. Если оба показателя количественные, то значение можно получить обычной операцией умножения, однако, если хотя бы один их показателей качественный и такая операция не определена, то можно воспользоваться матричным методом оценки. Строится матрица, где по вертикали откладываются вероятности происшествия (например, от А - минимальная до E - максимальная), а по горизонтали - прогнозируемые величины потерь. На пересечении актуальных столбцов и строк будет получен результат измерения:

Третий этап: Выявление средств защиты и переоценка рисков. Поскольку большинство компаний понимает, что они подвержены информационным рисками, они используют те или иные средства защиты от них. На данном этапе такие средства защиты группируются по классам угроз, от которых они защищают, и происходит переоценка рисков с учетом этих самых средств. Подход к измерению выражается формулой: 
МЕРА РИСКА = Р(угрозы)*Р(уязвимости)*Величина потерь
Вероятность происшествия тут разбита на две вероятностные характеристики: первая из них - вероятность угрозы - это вероятность того, что рисковое событие произойдет. Вторая - вероятность уязвимости - это вероятность того, что система защиты пропустит это событие.

Последний этап заключается в проведении финальной оценки и выдаче рекомендаций по управлению рисками. Как правило, компании выбирают одну из четырех основных стратегий управления рисками: 
  • Принятие - если риск мал и прогнозируемые потери не велики, компании как правило принимают такие риски.
  • Страхование - данная стратегия направлена на снижение величины возможных потерь, обычно за счет переложения части рисков на контрагентов.
  • Контроль - эта стратегия направлена на снижение вероятностей наступления рисковых событий. Примерами мер могут служить: использование более совершенных средств защиты, исправление ошибок, установка патчей
  • Избегание - если вероятность и возможные потери непозволительно велики, компании могут решить избежать таких рисков, избавившись от рискового актива.
Во время исполнения процесса анализа информационных рисков накапливается большое количество информации, нужной в дальнейшем. Для хранения такой информации возможно использование специального инструмента - базы данных. Такая БД должна хранить следующие сущности:
  • Информационный ресурс, характеризуется:
    • наименованием,
    • классом,
    • категорией,
    • описанием,
    • ответственным сотрудником;
  • Риск, характеризующийся:
    • названием,
    • сценарным анализом;
  • Средство защиты, характеризующееся:
    • названием,
    • комментарием
Между выделенными сущностями возможны следующие связи:

  • Между риском и ресурсом:
    • Для каждого ресурса - связные риски,
    • Для каждого риска – связные ресурсы,
    • Каждая связка риск-ресурс характеризуется:
      • Вероятностью,
      • Прогнозируемым ущербом,
      • Оценкой;
  • Между ресурсом, средством защиты и риском:
    • Для каждого риска - связные ресурсы и средства защиты,
    • Для каждого ресурса – связные риски и средства защиты,
    • Для каждого средства защиты – связные риски и ресурсы,
    • Каждая связь риск-ресурс-средство защиты характеризуется:
      • Значением угрозы,
      • Значением уязвимости,
      • Значением прогнозируемой степени ущерба,
      • Оценкой.
Для удобства использования  специалистами, не владеющими языками запросов (например, менеджерами) к такой БД разумно пристроить графический интерфейс. Основными требованиями к такого рода интерфейсу могут служить:
  1. Наличие интерфейсов CRUD-взаимодействия (создание, чтение, обновление и удаление записей)
  2. Наличие интерфейсов построения отчетов в трех формах:
    1. Текстовом (в виде заполненных бланков документов)
    2. Табличном (в виде двумерных таблиц)
    3. Графическом (в виде графиков различного типа)
Таким образом, в ходе данной работы были:

  1. Рассмотрены различные подходы к определению понятия информационный риск
  2. Описан и формализован процесс анализа информационных рисков
  3. На основе формализации процесса сделаны выводы о его предпочтительности: процесс выигрывает за счет
    1. своей непрерывности
    2. возможности построения актуального макета системы информационной безопасности
  4. Предложен вариант организации аналитической основы управления информационными рисками за счет внедрения использования специально спроектированной базы данных.

пятница, 4 июня 2010 г.

Интересное замечание

Когда появляется необходимость привлечь внимание спорящих или малововлеченных людей или просто в шумном месте, а также встает необходимость перебить кого-то или кому-то возразить, то обычное в таких ситуациях повышение голоса, как правило, не приносит должной реакции. Даже наоборот, оно вызывает еще большее сопротивление. Однако, стоит произнести нужную фразу простым уверенным, низким голосом (баритонистым, например), и цель достигнута: все замолкают и, хотя бы на время, начинают слушать. Удержать внимание - это уже цель другая, достигаемая за счет ораторского мастерства говорящего; но его привлечение, как правило, заслуга самого голоса.

Возникает вопрос, почему именно такие тембр и высота так привлекают людей? Психологи могут ответить, что это, например, было заложено в детстве, как голос отца, который доносился до нас, несмышленных малышей, в возрасте нескольких дней, или что это - память предков-неандертальцев, взыгрывающая в мозгу в этот момент, или любую другую похожую чушь.

Но мне кажется, все это происходит просто потому, что такой голос - красивый. Банально красивее прочих. И как человек замирает, увидев прекрасную картину или статую или заметив краем глаза природные красоты, так и тут люди вздрагивают от простой красоты, которая прорезает окружающий фон. Они замолкают в удовольствии, которое им доставляет слух, и в этот момент оратор продолжает свою речь. Все рукоплещут ему, как повелителю митингов, собраний, обсуждений, а благодарить то надо в первую очередь не его умения подбирать слова (хотя и их тоже), а то, что в людях еще есть чувство прекрасного и они могут им наслаждаться. И это прекрасно.

К слову о прекрасном голосе:

[ http://www.youtube.com/watch?v=sHR-o_tO-cY ]
Лучший.