Некоторые решения, теория и методы... Data minig, Text mining, Web-mining... Statistica, SPSS, Python, R, Weka, Rapidminer, ...и прочие прибамбасы для математиков и шахтеров
понедельник, 28 октября 2013 г.
Лучшая книга "The Text Mining Handbook" ...исполняется впервые... мною
После нескольких недель упражнений с Weka, Gator... Rapid Miner с удовольствием читаю эту книгу. Здесь все коротко и ясно... Какие задачи можно (и нужно) решать?Есть еще у меня много книг... Взять их можно, если кликнуть по картинке, справа на полях ссылки ... Сколько же понтов... в этих двух словечках "text mining". Но мы калачи тертые, поэтому захотелось разобраться с методиками исследований и теоретическими основами. Оказалось, что их не так много. Помимо основной книги, есть еще книга и курс на русском (в Интуите... ссылки есть в разделе меню "Text mining"). После беглого прочтения обнаружилось изрядное количество ссылок на онтологии и софт для работы с онтологиями. Надо срочно пробовать. Но все это представляется слишком трудоемким... Как быть? Ставим онтологии в очередь... сразу после Text mining... А перед этим - Data mining... 1. Сначала базовые понятия (символ, слово, фраза (термин), понятие), затем ( предложение, документ, корпус (пачка документов))... 2. Потом этапы: нормализация текстов, "ядро"- базовая обработка..., визуализация, совершенствование... 3. Что входит в "ядро"? Частоты, распределения... и ... ассоциации... всего-то? 4. Добавим сюда задачи классификации (деревья) и кластеризации... Но в текстах они и так очевидны - кластеры и категории... Это, когда избирателей классифицируют, то бывает трудно, а здесь все уже написано... анализа ассоциаций должно быть достаточно... Здесь задача обратная - классификаторы... уже есть... Поначалу быстро "пробежал" книгу, постарался запомнить основные понятия... И бросил это дело. Переключился на софт RapidMiner (об этом в следующих постах). Сейчас дописываю этот пост после прочтения книги "Data Mining for the Masses" by Dr. Matthew North и чувствую себя очень умным... поскольку снялся вопрос о том, какие методики обычно применяют при анализе текстов. Согласно стандарту CRISP-DM (CRoss-Industry Standard Process for Data Mining) можно использовать любые методики для полиномиальных (биномиальных) данных. Это немного непривычная терминология... поскольку в пакете Statistica использовались более консервативные понятия, например "порядковые" шкалы... Ссылки на онтологии ниже
Ярлыки:
Литература,
book,
gate,
ontology,
protege,
semantic,
textmining,
web
Подписаться на:
Комментарии к сообщению (Atom)
Комментариев нет:
Отправить комментарий