Не секрет, что многие методы анализа данных, такие как прогнозирование, распознавание образов, анализ сцен и др., широко используют всевозможные вероятностные методы. Все они, так или иначе трактуют понятие вероятности, прямо или косвенно.
В этой части мы кратко рассмотрим, как употребляются те или иные интерпретации вероятности в методах анализа данных.
Рассмотрим классическую задачу прогнозирования. Имеется некий временной ряд параметров, скажем количество дождливых дней в году за последние сто лет. Требуется на основе имеющихся данных спрогнозировать значение параметров в следующий момент, в нашем примере - количество дождливых дней в следующем году. Для простоты примера, будем считать, что нас лишь интересует, будет ли год дождливым или засушливым.
Возможно, точный ответ на этот вопрос и реально дать, но это потребует анализа огромного массива не имеющихся у нас данных, а также глубоко разработанной теории. Так как ничего этого у нас нет, то приходится решать данную задачу вероятностно. Итак, мы пытаемся оценить вероятность того, что следующий год будет дождливым.
Если бы у нас не было бы никаких знаний о предыдущих год (были ли они дождливые или нет), то искомую вероятность следовало бы положить равной 1/2 (вследствие принципа индифферентности). Если же мы, в силу логического анализа или статистики наблюдений, знаем хотя бы, что засушливые года в этой местности редки, то такое предположение уже не обоснованно. (Как видно, в этих рассуждениях мы использовали классическую интерпретацию вероятности).
Самым простым способом посчитать искомую вероятность будет посчитать количество дождливых лет за всю известную нам историю и поделить его на общее количество лет, за которые у нас есть данные. Отметим еще раз, что полученная относительная частота является всего лишь приближенной оценкой искомой вероятности. С помощью неравенства Чебышева мы можем оценить, с нужной нам долей достоверности (вероятности), насколько далека наша оценка от истинной. (Эти рассуждения, разумеется, проделаны в рамках частотной концепции).
Существуют и другие способы решить эту задачу. Например, даже не имея никаких данных, мы можем обратиться к экспертам (например, к местным жителям). Мы просим их оценить вероятность искомого события, а потом составляем среднюю взвешенную оценку, расставляя веса по степени компетентности каждого из опрошенных экспертов. Какие же интерпретации вероятности тут задействованы? Сами эксперты могут пользоваться всевозможными методами, и мы даже не знаем какими. Они могут пойти по пути классической или частотной концепций, могут провести опрос общественного мнения (вероятность как степень доверия), могут попытаться обосновать ответ с некоторой точностью, используя известные им приметы (логическая интерпретация), а могут, также как и мы, обратиться к другим экспертам.
Итак, на выходе мы получаем набор различных оценок искомой вероятности, полученных с использованием совершенно разных интерпретаций вероятности. Далее, чтобы получить взвешенную усредненную оценку, нам требуется оценить компетентность каждого из экспертов. Компетентность эксперта будет влиять на то, насколько ближе будет итоговый результат к его оценке. Чем больше верим мы эксперту, тем ближе будет усредненная оценка к его собственной. Но по существу, компетентность эксперта мы не можем оценить другим образом, кроме как опять-таки вероятностно. Для нас его компетентность будет эквивалентна вероятности того, что он не ошибся со своей оценкой. (Здесь имеется ввиду вероятность именно единичного события; того, что именно в этот раз эксперт не ошибся.). Эту вероятность мы можем оценить опять-таки разными методами. Частотным, предполагая, что вероятностные свойства эксперта не изменились, мы анализируем, сколько раз в прошлом этот эксперт ошибался. Логическим, считая, например, что местные жители несколько лучше ответят на этот вопрос, чем приезжие. Можем попросить экспертов самим дать оценку друг другу и т.д.
В результате у нас получается сумма произведений компетентностей экспертов на их оценки искомой вероятности. Но, и компетентности экспертов и их оценки, как вероятности посчитаны в различных концепциях, в которых под вероятностью подразумевается различные объекты. Результат осложняется еще и тем, что мы не всегда даже можем знать, в какой парадигме работал тот или иной эксперт.
Имеем ли мы право, вот так, все сваливать в одну кучу или нет? В какой парадигме получится тогда усредненный результат? Какую интерпретацию этого результата предпочесть?
Прояснить эти вопросы, возможно, было бы проще, поняв не только различия между интерпретациями вероятности, но также их общую составляющую и взаимосвязь друг с другом.