Парсер видеосайтов для видеосайта
Budget: €30 – €250 EUR
Нужно сделать двухэтапный парсер для видеосайтов.
Этап 1 - парсер ссылок "матрешкой".
Нужно сделать парсер, который обходит сайт по принципу "матрешки":
заходим на главную страницу сайта;
собираем все внутренние ссылки с неё;
заходим в каждую найденную ссылку и снова собираем с неё все новые внутренние ссылки;
дальше повторяем этот процесс, пока не обойдём весь сайт (пока не останется новых ссылок внутри домена);
парсер не должен бесконечно ходить по кругу — повторные ссылки нужно отсекать.
Задача первого этапа:
Обходить все внутренние страницы заданного домена по принципу «от внешнего к внутреннему», как вложенные уровни («матрёшка»).
Собрать:
все уникальные внутренние ссылки сайта;
отдельный список ссылок на страницы, где реально есть видеоплеер / видеоролик (страницы с видео).
На выходе первого этапа должен быть:
полный список URL внутри сайта;
отдельный список URL видеостраниц, которые пойдут на обработку во втором этапе.
Этап 2 — парсер видео и данных с видеостраниц.
На втором этапе нужно обработать список видеостраниц, который получен на первом этапе.
1. Для каждой страницы с видео нужно найти реальные ссылки на видеопотоки / файлы в следующих форматах:
mp4
webm
m3u8
mpd
Если на сайте есть несколько качеств / несколько источников — хорошо, можно забирать несколько ссылок (основное, чтобы было чем накормить свой плеер).
Задача по форматам:
найти прямые ссылки на видеофайл или плейлист в этих форматах;
вернуть их в таком виде, чтобы потом можно было встроить это видео в свой сайт в собственный видеоплеер.
2. Для каждой видеостраницы нужно, максимально полно, вытащить всё, что нужно для отображения видео на моём сайте максимально похоже на оригинал:
заголовок видео;
описание видео;
теги / ключевые слова;
превью / постеры;
Желательные дополнительные поля, если их можно достать:
дата публикации;
количество просмотров;
рейтинг / лайки;
имя канала / автора / студии;
актёры / участники;
комментарии;
3. Все данные по каждому ролику должны быть сохранены в структурированном виде (набор полей/колонок, чтобы потом можно было положить в базу данных).
Цель — чтобы на моём сайте можно было:
встроить видео в собственный плеер с использованием спарсенных ссылок;
показывать всю основную информацию о видео максимально близко к оригиналу (заголовок, описание, теги, превью).
Реализация внутренней логики (например использование ИИ внутри парсера для определения, где заголовок, где описание, где актёры, где комментарии) - на ваше усмотрение. Главное, чтобы все указанные поля были корректно заполнены на выходе.
Этап 1 - парсер ссылок "матрешкой".
Нужно сделать парсер, который обходит сайт по принципу "матрешки":
заходим на главную страницу сайта;
собираем все внутренние ссылки с неё;
заходим в каждую найденную ссылку и снова собираем с неё все новые внутренние ссылки;
дальше повторяем этот процесс, пока не обойдём весь сайт (пока не останется новых ссылок внутри домена);
парсер не должен бесконечно ходить по кругу — повторные ссылки нужно отсекать.
Задача первого этапа:
Обходить все внутренние страницы заданного домена по принципу «от внешнего к внутреннему», как вложенные уровни («матрёшка»).
Собрать:
все уникальные внутренние ссылки сайта;
отдельный список ссылок на страницы, где реально есть видеоплеер / видеоролик (страницы с видео).
На выходе первого этапа должен быть:
полный список URL внутри сайта;
отдельный список URL видеостраниц, которые пойдут на обработку во втором этапе.
Этап 2 — парсер видео и данных с видеостраниц.
На втором этапе нужно обработать список видеостраниц, который получен на первом этапе.
1. Для каждой страницы с видео нужно найти реальные ссылки на видеопотоки / файлы в следующих форматах:
mp4
webm
m3u8
mpd
Если на сайте есть несколько качеств / несколько источников — хорошо, можно забирать несколько ссылок (основное, чтобы было чем накормить свой плеер).
Задача по форматам:
найти прямые ссылки на видеофайл или плейлист в этих форматах;
вернуть их в таком виде, чтобы потом можно было встроить это видео в свой сайт в собственный видеоплеер.
2. Для каждой видеостраницы нужно, максимально полно, вытащить всё, что нужно для отображения видео на моём сайте максимально похоже на оригинал:
заголовок видео;
описание видео;
теги / ключевые слова;
превью / постеры;
Желательные дополнительные поля, если их можно достать:
дата публикации;
количество просмотров;
рейтинг / лайки;
имя канала / автора / студии;
актёры / участники;
комментарии;
3. Все данные по каждому ролику должны быть сохранены в структурированном виде (набор полей/колонок, чтобы потом можно было положить в базу данных).
Цель — чтобы на моём сайте можно было:
встроить видео в собственный плеер с использованием спарсенных ссылок;
показывать всю основную информацию о видео максимально близко к оригиналу (заголовок, описание, теги, превью).
Реализация внутренней логики (например использование ИИ внутри парсера для определения, где заголовок, где описание, где актёры, где комментарии) - на ваше усмотрение. Главное, чтобы все указанные поля были корректно заполнены на выходе.