#lxml — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #lxml, aggregated by home.social.

Gea-Suan Lin @[email protected] · 2026-03-03 · 00:42 UTC

https://blog.gslin.org/archives/2026/03/03/12911/2025-%e5%b9%b4%e7%88%ac%e5%8d%81%e5%84%84%e5%80%8b%e9%a0%81%e9%9d%a2%e7%9a%84%e6%88%90%e6%9c%ac/
2025 年爬十億個頁面的成本
#amazon #aws #cloud #crawler #crawling #engine #html #https #javascript #js #library #lxml #performance #search #selectolax #service #speed #ssl #tls #web #webpage

#amazon #aws #cloud #crawler #crawling #engine
Gea-Suan Lin @[email protected] · 2026-03-03 · 00:42 UTC

https://blog.gslin.org/archives/2026/03/03/12911/2025-%e5%b9%b4%e7%88%ac%e5%8d%81%e5%84%84%e5%80%8b%e9%a0%81%e9%9d%a2%e7%9a%84%e6%88%90%e6%9c%ac/
2025 年爬十億個頁面的成本
#amazon #aws #cloud #crawler #crawling #engine #html #https #javascript #js #library #lxml #performance #search #selectolax #service #speed #ssl #tls #web #webpage

#amazon #aws #cloud #crawler #crawling #engine
Gea-Suan Lin @[email protected] · 2026-03-03 · 00:42 UTC

https://blog.gslin.org/archives/2026/03/03/12911/2025-%e5%b9%b4%e7%88%ac%e5%8d%81%e5%84%84%e5%80%8b%e9%a0%81%e9%9d%a2%e7%9a%84%e6%88%90%e6%9c%ac/
2025 年爬十億個頁面的成本
#amazon #aws #cloud #crawler #crawling #engine #html #https #javascript #js #library #lxml #performance #search #selectolax #service #speed #ssl #tls #web #webpage

#amazon #aws #cloud #crawler #crawling #engine
Gea-Suan Lin @[email protected] · 2026-03-03 · 00:42 UTC

https://blog.gslin.org/archives/2026/03/03/12911/2025-%e5%b9%b4%e7%88%ac%e5%8d%81%e5%84%84%e5%80%8b%e9%a0%81%e9%9d%a2%e7%9a%84%e6%88%90%e6%9c%ac/
2025 年爬十億個頁面的成本
#amazon #aws #cloud #crawler #crawling #engine #html #https #javascript #js #library #lxml #performance #search #selectolax #service #speed #ssl #tls #web #webpage

#webpage #web #tls #ssl #speed #service
Gea-Suan Lin @[email protected] · 2026-03-03 · 00:42 UTC

https://blog.gslin.org/archives/2026/03/03/12911/2025-%e5%b9%b4%e7%88%ac%e5%8d%81%e5%84%84%e5%80%8b%e9%a0%81%e9%9d%a2%e7%9a%84%e6%88%90%e6%9c%ac/
2025 年爬十億個頁面的成本
#amazon #aws #cloud #crawler #crawling #engine #html #https #javascript #js #library #lxml #performance #search #selectolax #service #speed #ssl #tls #web #webpage

#amazon #aws #cloud #crawler #crawling #engine
sheerluck @[email protected] · 2025-04-16 · 11:40 UTC

#lxml

To build lxml-5.3.2 with python3_13t you have to remove PY_NEW and __pyx_empty_tuple using the commits from the main branch. So you will get lxml-9999 actually :meowflower:

#lxml
Simon 🐮:spot: @[email protected] · 2025-03-06 · 00:20 UTC

Quite literally, #fuck all your searches!
It really helps!
Exhibit A: A search for a failed #python #lxml build on #DuckDuckGo returns a useless "AI" helptext.
Exhibit B: Change the search from "Faild to build" to "Failed to fucking build" returns normal search results.
#Fucking with your search queries is useful

#fuck #python #lxml #duckduckgo #fucking
Habr @[email protected] · 2023-12-14 · 06:17 UTC

Бенчмарк HTML парсеров в Python: сравнение скорости
Привет, Хабр! Меня зовут Вадим Москаленко и я разработчик инновационных технологий Страхового Дома ВСК. В этой статье хочу поделиться с вами информацией по проведенному сравнению производительности нескольких популярных библиотек для простого HTML-парсинга. При необходимости сбора данных с HTML или XML, многим python-разработчикам сразу вспомнятся две популярные библиотеки «BeautifulSoup4» и «lxml» — они весьма удобны и стали широко применяемыми. Но что, если в нашем проекте важна скорость сбора данных? Возникает вопрос: кто из них быстрее и есть ли еще более быстрые библиотеки? При поиске данной информации на Хабре, я нашел подобные статьи, но им уже несколько лет. Так как прогресс не стоит на месте и появляются новые инструменты или те, о которых еще не слышали, мне было интересно провести личное исследование и поделиться информацией. Ремарка: выбор библиотеки зависит от конкретных требований проекта, также существует еще множество инструментов, которые не были освещены в данной статье, к примеру «Scrapy» — это мощный асинхронный фреймворк. В исследовании акцентируется внимание на более простой задаче, поэтому я не гарантирую что лидер бенчмарка подойдет именно вам. Помните о важности проведения собственных тестов и анализа требований вашего проекта перед принятием решения. В качестве задачи используем поисковик нашего любого habr.com , в который отправим запрос с ключевыми словами «html parsing python» и соберем следующие данные по каждой статье: имя автора, заголовок, дату создания статьи, количество просмотров и голоса (оценки).
https://habr.com/ru/companies/vsk_insurance/articles/780500/
#benchmark #бенчмарк #html #parsing #python #beautifulsoup4 #lxml #parsel #requestshtml #selectolax

#selectolax #requestshtml #parsel #lxml #beautifulsoup4 #python
Habr @[email protected] · 2023-12-14 · 06:17 UTC

Бенчмарк HTML парсеров в Python: сравнение скорости
Привет, Хабр! Меня зовут Вадим Москаленко и я разработчик инновационных технологий Страхового Дома ВСК. В этой статье хочу поделиться с вами информацией по проведенному сравнению производительности нескольких популярных библиотек для простого HTML-парсинга. При необходимости сбора данных с HTML или XML, многим python-разработчикам сразу вспомнятся две популярные библиотеки «BeautifulSoup4» и «lxml» — они весьма удобны и стали широко применяемыми. Но что, если в нашем проекте важна скорость сбора данных? Возникает вопрос: кто из них быстрее и есть ли еще более быстрые библиотеки? При поиске данной информации на Хабре, я нашел подобные статьи, но им уже несколько лет. Так как прогресс не стоит на месте и появляются новые инструменты или те, о которых еще не слышали, мне было интересно провести личное исследование и поделиться информацией. Ремарка: выбор библиотеки зависит от конкретных требований проекта, также существует еще множество инструментов, которые не были освещены в данной статье, к примеру «Scrapy» — это мощный асинхронный фреймворк. В исследовании акцентируется внимание на более простой задаче, поэтому я не гарантирую что лидер бенчмарка подойдет именно вам. Помните о важности проведения собственных тестов и анализа требований вашего проекта перед принятием решения. В качестве задачи используем поисковик нашего любого habr.com , в который отправим запрос с ключевыми словами «html parsing python» и соберем следующие данные по каждой статье: имя автора, заголовок, дату создания статьи, количество просмотров и голоса (оценки).
https://habr.com/ru/companies/vsk_insurance/articles/780500/
#benchmark #бенчмарк #html #parsing #python #beautifulsoup4 #lxml #parsel #requestshtml #selectolax

#selectolax #requestshtml #parsel #lxml #beautifulsoup4 #python
adamghill @[email protected] · 2023-10-12 · 23:27 UTC

Using https://pytest-benchmark.readthedocs.io to compare #regex vs #HTMLParser vs lxml.html vs #BeautifulSoup with a typical @unicorn #HTML component fragment.
Still haven't figured out how to use parsel. And still scared to use #regex even though it would be way faster. 🥺
#python #lxml #pytest #benchmark

#benchmark #pytest #lxml #python #html #beautifulsoup
DeaDSouL :fedora: @DeaDSouL · 2022-11-23 · 11:01 UTC

#Python #Frameworks #Libraries #numpy #tensorflow #theano #pandas #pytorch #keras #matplotlib #scipy #seaborn #django #flask #bottle #cherrypy #pyramid #web2py #turboGears #cubic #dash #falcon #pyunit #behave #splinter #robot #pytest #opencv #mahotas #pgmagick #simpletk $scikit #arcade #pyglet #pyopengl #pygame #panda3d #lxml #requests #selenium #scrapy #code #developing #programming #coding

#python #frameworks #libraries #numpy #tensorflow #theano
DeaDSouL :fedora: @[email protected] · 2022-11-23 · 11:01 UTC

#Python #Frameworks #Libraries #numpy #tensorflow #theano #pandas #pytorch #keras #matplotlib #scipy #seaborn #django #flask #bottle #cherrypy #pyramid #web2py #turboGears #cubic #dash #falcon #pyunit #behave #splinter #robot #pytest #opencv #mahotas #pgmagick #simpletk $scikit #arcade #pyglet #pyopengl #pygame #panda3d #lxml #requests #selenium #scrapy #code #developing #programming #coding

#python #frameworks #libraries #numpy #tensorflow #theano
DeaDSouL :fedora: @[email protected] · 2022-11-23 · 11:01 UTC

#Python #Frameworks #Libraries #numpy #tensorflow #theano #pandas #pytorch #keras #matplotlib #scipy #seaborn #django #flask #bottle #cherrypy #pyramid #web2py #turboGears #cubic #dash #falcon #pyunit #behave #splinter #robot #pytest #opencv #mahotas #pgmagick #simpletk $scikit #arcade #pyglet #pyopengl #pygame #panda3d #lxml #requests #selenium #scrapy #code #developing #programming #coding

#python #frameworks #libraries #numpy #tensorflow #theano
DeaDSouL :fedora: @[email protected] · 2022-11-23 · 11:01 UTC

#Python #Frameworks #Libraries #numpy #tensorflow #theano #pandas #pytorch #keras #matplotlib #scipy #seaborn #django #flask #bottle #cherrypy #pyramid #web2py #turboGears #cubic #dash #falcon #pyunit #behave #splinter #robot #pytest #opencv #mahotas #pgmagick #simpletk $scikit #arcade #pyglet #pyopengl #pygame #panda3d #lxml #requests #selenium #scrapy #code #developing #programming #coding

#coding #programming #developing #code #scrapy #selenium
DeaDSouL :fedora: @[email protected] · 2022-11-23 · 11:01 UTC

#Python #Frameworks #Libraries #numpy #tensorflow #theano #pandas #pytorch #keras #matplotlib #scipy #seaborn #django #flask #bottle #cherrypy #pyramid #web2py #turboGears #cubic #dash #falcon #pyunit #behave #splinter #robot #pytest #opencv #mahotas #pgmagick #simpletk $scikit #arcade #pyglet #pyopengl #pygame #panda3d #lxml #requests #selenium #scrapy #code #developing #programming #coding

#python #frameworks #libraries #numpy #tensorflow #theano