вторник, 5 ноября 2013 г.

Два примера web-mining анализа информации о футбольных матчах и финансовой информации в RapidMiner

Пытался взять за основу статью "Scraping Web Data with Rapidminer" (клик по картинке). Но статья оказалась слишком поверхностной, зато нашел хорошее видео Это один из первых постов, я пробую отразить свой процесс обучения... Какие вопросы возникали у меня ("где же эта кнопка") и описываю, как находил нужные материалы материалы...)
Сначала мы копируем (вручную, как я понял, простым копипастом) таблицы из web-страницы в Excel, потом редактируем Excel-файл, чтобы ипользовать его, как источник ссылок для последующего парсинга страниц. Затем по списку скачиваем страницы, превращаем их в текст (убираем теги)и фильтруем токены, а потом все их записываем в новый файл. Изначально этот пост вызвал подозрения, попытка повторить его в RapidMiner... привела к ошибке уже во втором операторе "Gets pages from URLs in an attribute and stores them into a new attribute". Не смог понять, что писать в поле "Get attribute". Было это ночью... и все вместе - безграмотная методика (Токены вместо XPath), умышленно сокращенный пост (зачем автору выставлять себя идиотом?), подобные посты в других блогах (см. меню), большое количество ссылок в поиске Гугла... навели на мысль, надо искать по именам процессов. Пробуем гуглить "get pages rapidminer" и сразу же находим видео на целых 15 минут. Смотрим, да... здесь все начинается с "Read Excel"... оказывается, нужно сначала использовать Wizard и настроить форматы... в видео предлагается использовать для этого столбца "file_path". А у меня где Wizard? Ах, вот наверху кнопочка... Прочему я на нее внимания не обращал? Очень просто, я думал, что это альтернатива тому, что настраивается внизу вручную. Ничего подобного, если форматы полей не настроишь, в следующем операторе "Get Pages" вместо выпадающего списка имен полей в окошке "Link attribute" пусто... Здесья я описываю процесс моего (само)обучения. Я делаю ошибки... и пытаюсь проанализировать, почему они возникают. Конечно, это ценная информаци..., но только для улучшения процесса обучения моего... и тех, кто будет учиться у меня... Оператор "Get Pages" только отправляет HTTP запросы и дожидается ответа "200 OK". Чтобы скачать страницы, нужно использовать "Data to Documents " (Generates documents from values contained within a data set)Ниже RSS c сайта

2 комментария:

  1. В хорошем видео (ссылка во кратком введении) автор задает список сайтов:
    http://maoxian.com/
    http://www.stocktwits.com/symbol/IYT
    http://www.neuralmarkettrends.com/
    http://stocktwits.com/symbol/CSX

    Интересна идея стоктвитов. Там в режиме реального времени обсуждается трейдинг...

    ОтветитьУдалить
  2. Авто видео сделал неплохой видеоканал (не забыть все посмотреть)
    http://www.youtube.com/user/neuralmarkettrends1

    ОтветитьУдалить