Парсинг на Python: с чего лучше начать и что выбрать?
В общем, решил попробовать парсить данные с сайтов на Python, но сразу забросило в ступор с кучей библиотек и подходов. Кто чего юзает на старте — requests + BeautifulSoup, Scrapy, или может Selenium? Вроде requests и BS проще, но не всегда справляются с динамическими страницами. Scrapy мощный, но кажется, что для новичка крутоват. Selenium – тут все понятно, браузер запускается, но тормознуто и требует настройки.
По моим ощущениям, если нужно быстро и просто — requests+BS, если хочется масштабного парсера с логикой — Scrapy, а для сайтов на JS без API — Selenium.
Кто как проверяет на правильность? Обычно ловлю ошибки вида страница не загрузилась, меняю user-agent, логику с задержками. Никто не рассказывал, как лучше — писать дебаг логи или смотреть код страницы руками?
Еще думал про aiohttp для асинхронности, но видел, что с ним может быть морока при отладке. В итоге, нужна какая-то понятная дорожка для новичка, чтобы не заблудиться между этими вариантами и понять, когда стоит пересесть с одного инструмента на другой.
Кто сталкивался, как обычно делаете выбор? Есть ли очевидные ошибки, о которых лучше не вспоминать?
Если хочешь просто поглазеть, что там внутри страницы — requests + BS хватит с лихвой. Scrapy и Selenium — как швейцарский нож, но без конкретной задачи только запутаешься. А с дебагом — просто пиши в консоль, пока не перестанешь искать баги в отражении страницы