Нашел интересную статью "Tool for Computing Continuous Distributed Representations of Words" на сайте Data Science Central" Сейчас не до нее, за Text Mining будущее... А с сайта можно транслировать несколько потоков RSSВ статье есть ссылки на "Google has open sourced a tool for computing continuous distributed representations of words that provides an efficient implementation of the continuous bag-of-words and skip-gram architectures for computing vector representations of words."
Интересно все... и статья, и ресурс и код в Гугл... Но времени нету. Нужно будет сюда вернутся... Здесь в статье, насколько я понял, дается краткое описание испоьзования подходов NLP для того, чтобы для объекта-понятия использовать не только токен (со стеммером), но построить целый вектор из слов с ошибками, опечатками... и проч... Нужно будет обязательно вернуться к этому посту... Examples of NLP algorithms include n-gram language modeling, naive bayes and maxent classifiers, sequence models like Hidden Markov Models, probabilistic dependency and constituent parsing, and vector-space models of meaning.Ниже RSS c сайта
Некоторые решения, теория и методы... Data minig, Text mining, Web-mining... Statistica, SPSS, Python, R, Weka, Rapidminer, ...и прочие прибамбасы для математиков и шахтеров
вторник, 5 ноября 2013 г.
Инструмент для создания непрерывно распределенных векторов слов (подстрочник)
Подписаться на:
Комментарии к сообщению (Atom)
Комментариев нет:
Отправить комментарий