home.social

#beautifulsoup — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #beautifulsoup, aggregated by home.social.

fetched live
  1. Скрапер Google Maps на Playwright: семь граблей, на которые я наступил

    Задача звучала просто: получить список компаний определённого профиля в конкретном городе — с сайтом и способом связаться. Не телефоном, а email / Telegram / WhatsApp. Итоговый скрипт — примерно 400 строк: Playwright для Maps, requests + BeautifulSoup для сайтов, регексы для контактов, txt на выходе. Ниже — не туториал "как повторить", а список мест, где всё ломается. Вот весь конвейер целиком, с отмеченными точками отказа — дальше по статье разберём каждую:

    habr.com/ru/articles/1073446/

    #python #playwright #парсинг #вебскрапинг #google_maps #регулярные_выражения #beautifulsoup #cssселекторы

  2. NO SOUP FOR YOU!

    Playwright
    + Ollama
    ==TRANSLITERATE==
    BEAUTIFUL DATA

    Build a self-auditing data pipeline that keeps my MariaDB in perfect sync.

    Full workflow: dufospy.com/artificial-intelli

    #Beautifulsoup #Playwright #data #scraping

    @playwrightweb

    @JamieWitter

    @ollama

  3. Основы парсинга сайтов: от HTML до готового датасета для NLP

    Даже сильная NLP‑модель быстро упирается в банальную проблему: ей нужны данные, причём не абстрактные «готовые датасеты», а тексты под конкретную задачу, домен и гипотезу. В статье разберём базовый путь от HTML‑страницы до пригодного корпуса: как получать данные через HTTP‑запросы, доставать нужные элементы с помощью BeautifulSoup, работать с CSS‑селекторами, подключать Playwright для динамических сайтов и очищать сырой веб‑текст так, чтобы его уже можно было использовать в NLP‑пайплайне.

    habr.com/ru/companies/otus/art

    #парсинг_сайтов #Python #HTML #BeautifulSoup #requests #Playwright #NLP #датасет #очистка_данных #языковые_модели

  4. Парсинг тарифов интернета и ТВ. Selenium + BeautifulSoup: трудности динамического контента и защиты от ботов

    На этапе тестирования я отобрал 6 городов (Москва, Санкт-Петербург, Новосибирск, Екатеринбург, Казань, Красноярск) и двух крупнейших провайдеров России - Ростелеком и Дом.ру. В планах масштабирование на большее количество городов и операторов. Для парсинга тарифов у провайдеров применял связку Python + Selenium + BeautifulSoup, через хранимую процедуру складывал полученные данные в базу PostgreSQL.

    habr.com/ru/articles/1017230/

    #парсинг #Selenium #BeautifulSoup #PostgreSQL #динамические_сайты #защита_от_ботов #Python #тарифы

  5. Парсинг тарифов интернета и ТВ. Selenium + BeautifulSoup: трудности динамического контента и защиты от ботов На этапе т...

    #парсинг #Selenium #BeautifulSoup #PostgreSQL #динамические #сайты #защита #от #ботов #Python #тарифы

    Origin | Interest | Match
  6. Парсинг сайтов на Python: изучаем BeautifulSoup

    Библиотека bs4, а если точнее её класс BeautifulSoup используется для эффективного поиска элементов на html странице. Установка: pip install beautifulsoup4, lxml Для запросов установите библиотеку requests, если она у вас не установлена: pip install requests Тренироваться будем на «тренажёре». Получаем HTML-документ по HTTP и строим DOM-дерево с помощью BeautifulSoup

    habr.com/ru/articles/986284/

    #парсинг #scraping #beautifulsoup

  7. Collecting Localized Retail Promotions from Best Buy and Walmart: A Developer-First Approach Modern retail websites rarely show the same data to everyone. Promotions on platforms like Best Buy and ...

    #scrapy #rapidproxy #beautifulsoup #requests

    Origin | Interest | Match
  8. Selectolax: быстрая альтернатива Beautiful Soup

    Если спросить у питониста: «Чем парсить сайт?», — в большинстве случаев он ответит Selenium или Beautiful Soup . И будет по-своему прав — это два главных направления в мире парсинга на Python. Selenium , со всем своим множеством форков, наследников и схожих по принципу библиотек, — инструмент мощный. Он отлично подходит для сложных сценариев, работы с динамическими сайтами и автоматизации действий пользователя в браузере. Но за это удобство приходится платить: Selenium требует немало системных ресурсов и работает заметно медленнее. Beautiful Soup (или просто «суп») — полная противоположность. Он лёгкий, быстрый и прекрасно справляется с «простыми» сайтами, где нет интерактивных элементов и сложного JavaScript. В этой статье я расскажу об альтернативе Beautiful Soup — библиотеке Selectolax , воплощающую в себе простоту использования и высокую скорость работы. Если вам интересны подобные материалы и проекты, подписывайтесь на Telegram-канал «Код на салфетке» — там я делюсь гайдами для новичков и полезными инструментами.

    habr.com/ru/articles/961590/

    #python #парсинг #beautifulsoup #selectolax

  9. Last week I deployed a change to how I generate plain text versions of content on my website. This week I changed it again. And updated additional post types to use Markdown as their editing and storage format.

    orangegnome.com/posts/3622/cha

    #Html #WebDevelopment #Indieweb #Markdown #BeautifulSoup #Changelog #Microformats #Mistune #Html2Text

  10. Парсинг российских СМИ

    В эпоху больших языковых моделей полноценный сбор информации с сайтов все еще не самый очевидный сценарий, требующий учета многих мелких деталей, а также понимания принципов работы сайта и взаимодействия с ним. В этом случае единственный оптимальный метод сбора такой информации - это парсинг. В данной статье мы сфокусируемся на парсинге сайтов российских СМИ, в числе которых Meduza ,* как официально запрещенное в РФ и более государственно-подконтрольных RussiaToday и Коммерсанта . Разберемся какой это сделать наиболее эффективно и получим текст и метаданные статей. Как основные инструменты используем классические библиотеки в Python: requests, BeautifulSoup, Selenium .

    habr.com/ru/articles/930188/

    #парсинг #beautifulsoup #selenium #python #сбор_данных

  11. @BuschnicK

    I found #BeautifulSoup for #Python really helpful for parsing web pages. But I guess you're set on C++...

  12. I'm facilitating an Open Space at #PyConUS:

    Beautiful Soup: Ask Me Anything
    Sun. May 18th; 2-3pm

    An open questions session with @leonardr, the maintainer of screen-scraping library #BeautifulSoup. If you've ever used or tried to use it, share your questions, confusions, stuff you've made, concerns, ideas, offers of help, etc. with Leonard in person. If we don't have a ton of questions, we might do some impromptu usability testing to check whether the new type hints help you use the library.

  13. Простые лайфхаки для автоматизации работы с помощью Python

    Если какое-то действие приходится выполнять слишком часто — значит, пора его автоматизировать. Разбираю полезные скрипты — от работы с файлами до DevOps. В каждом разделе есть примеры для новичков и более опытных разработчиков. А в конце статьи — несколько простых правил, которые помогут писать удобный и надёжный код.

    habr.com/ru/companies/netology

    #python #автоматизация #скрипты_для_автоматизации #json #shutil #autopep8 #вебскрапинг #excel #отправка_отчётов #beautifulsoup

  14. And now @leonardr has "released the biggest update to Beautiful Soup in many years." Upgrade to 4.13.1 to enjoy better warnings, type hints, generated API docs, and more.

    wandering.shop/@leonardr/11393

    #Python #civictech #opensource #FLOSS #BeautifulSoup #civicdata #datascience #scraping #webscraping #datahoarder

  15. I made some changes to my Notes:

    - Better HTML and plain text output support
    - Only enforce plain text character count and only when publishing
    - See the plain text character count live in the Admin UI

    orangegnome.com/posts/3343/cha

    #Javascript #Html #Django #WebDevelopment #Python #WebComponents #Markdown #Pandoc #Pypandoc #BeautifulSoup

  16. Funny thing. A colleague asked me to help him write a script that fixes some old HTML content (around 8000 pages), to make it compatible with our flavor of richtext editor.

    Turns out, it's less tiresome to ask llama3.3-70b to "pretty-please, fix this for me" than it is to write a script that covers all the cases.

  17. @aziz This is the offending code. You can see there's nothing there, it extracts one div. (200 files, each no more than 40k, takes six seconds. Has to be a bug?):

    p = []
    for html in glob('*.html'):
    with open(html) as fp:
    soup = BeautifulSoup(fp, features='html.parser')
    pmap = soup.find('div', 'prod-contact')
    p.append(pmap)

    #Python #BeautifulSoup

  18. I've been working on a #python webscraping #data collection app using #beautifulsoup library and pulling out #mariadb data through a #metabase report for local non-permanent #housing in my state of #washington, specifically #graysharbor county.

    I have a public report avail now over at reports.hogaboom.org/dashboard

    Code is on #github github.com/ralphhogaboom/chick

  19. Kennt sich hier jemand mit WebScraping aus?

    Ich will alle Urls von dieser Seite bekommen, dafür muss man ein paar mal den ›Weitere Ergebnisse laden‹-Button unten drücken. Ich versuche es mit #Python (cfscraper/requests und #BeautifulSoup), aber ich bekomme die richtige POST-Anfrage nicht hin, um alle die Seite mit allen Ergebnissen zu haben.

    Jemand Ideen?

    Hier ist die Seite: neubaukompass.de/neubau-immobi

    Udpate: Hab das Problem gelöst, hab die POST-Anfrage aus Firefox übernommen.

  20. @Catweazle

    Hey there! I did check this out, BTW. I recall, couple mnths ago or so, i was like: What in the heck is this? haha...

    Needing to check that again!

    What are you up-to over there besides bleeding the Red-&-White @Vivaldi
    :D

    You mess w/ #Flask ?
    #BeautifulSoup and the like?

  21. [Перевод] Лучшие библиотеки Python для Data Science в 2024 году

    Python — один из самых распространенных языков программирования в Data Science (третье место в опросе разработчиков StackOverflow). Популярность языка обусловлена наличием множества пакетов, которые можно использовать для решения различных задач в области науки о данных, включая машинное обучение, предварительную обработку данных, анализ данных и их визуализацию. Новичку в этой области может быть сложно понять, с чего начать, особенно при таком обилии ресурсов — в Python имеется более 100 000 встроенных библиотек, и выучить их все просто невозможно. Именно поэтому в этой статье мы рассмотрим 8 самых полезных библиотек Python для Data Science.

    habr.com/ru/companies/products

    #python #data #data_science #библиотека #library #pandas #beautifulsoup #matplotlib #scikitlearn #tensorflow

  22. tain c'est honteux que le service public soit pas foutu de sortir un jeu de données de résultats d'élections structuré qu'on ait pas besoin de scrapper pour chopper l'ensemble des infos.

    remercions #beautifulsoup et consorts

  23. Développé en Python, avec #BeautifulSoup pour analyser le HTML des sites Web.
    #scraping

    Interface utilisateur : le Web. Utilisation de #Flask pour faire le serveur HTTP. Avec notifications IRC.

    #PSES

  24. #PyConUS Open Spaces for 2pm:

    Room 308: Bayesian Statistics
    Room 309: Internal AI Tooling
    Room 310/311: Creator Economy
    Room 315: 20th Anniversary of #BeautifulSoup (1:45-2:30)
    Room 316: QA Automation
    Room 318: #PyScript and #PySheets Spreadsheets
    Room 319: Ricing
    Room 320: Advanced Knitting Theory

    Meet By The Open Spaces Board: Pokemon Go Community Day

    #PyCon #PyConUSOpenSpaces #PyConUS2024

  25. Celebrate Beautiful Soup's 20th Anniversary buff.ly/3yjVAxK

    "Sunday, May 19th, 1:45-2:30pm.] Leonard would make a short speech, and a few people would give five-minute lightning talks about cool things they did with Beautiful Soup "

    #html #api360 #BeautifulSoup

  26. one issue i encountered: the official #bluesky #api works, you can add hashtags, links, and create longer messages (threads)

    however, the links are only clickable, no #thumbnail and other information are shown directly ⟶ which is done for you #automatically by #linkedin as an example

    so the solution is, we need to fetch some data ourselves and then pass them to the link card. we might use #requests, #httpx, #BeautifulSoup, #selenium, or my current favorite #playwright

  27. Уже не первый год использую #BeautifulSoup и всё ещё не понимаю как оно работает.

    RaZZlom - Найди мне параграф со строкой "строка".
    BS - None
    RaZZlom - Найди мне любой элемент со строкой "строка".
    BS - Держи параграф со строкой "строка"!
    RaZZlom - >_<

  28. github.com/Makaze/csschooser

    Interactive CLI CSS Chooser for making BeautifulSoup and Scrapy scripts.

    CS50P certificate achieved in <1 week! I'm glad I did it; I've needed to make something for quite some time.

Share on Mastodon

Enter the server where you have an account.