home.social

#ner — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #ner, aggregated by home.social.

fetched live
  1. AudioToText: управление требованиями через записи встреч

    Как превратить записи встреч в рабочий материал для согласования требований: текущая версия проекта AudioToText. В статье показываю, как собрать сервис транскрибации на базе MLX Whisper и Django, чтобы автоматически получать структурированные протоколы созвонов, а не просто длинные текстовые файлы. Разбираю сценарий работы, ключевые элементы веб‑интерфейса, review‑контур и планы развития проекта в сторону NER и поиска противоречий по summary. Как запись встречи становится рабочим арте

    habr.com/ru/articles/1067208/

    #audiototext #asr #nlp #nlp_обработка_текста #speech_recognition #diarization #ner

  2. Der "Werkstattbericht" der Gruppe Rara und #Karten der ETH-Bibliothek ist veröffentlicht: Er gibt Einblicke in aktuelle Tätigkeiten, Projekte und Plattformen

    doi.org/10.3929/ethz-c-0008026

    #ethbibliothek #altedrucke #map #maps #rarebooks #ethz #ner #nel #geodaten #erara

  3. Der "Werkstattbericht" der Gruppe Rara und #Karten der ETH-Bibliothek ist veröffentlicht: Er gibt Einblicke in aktuelle Tätigkeiten, Projekte und Plattformen

    doi.org/10.3929/ethz-c-0008026

    #ethbibliothek #altedrucke #map #maps #rarebooks #ethz #ner #nel #geodaten #erara

  4. Bookmarked: TEI-NER Pipeline — Automatisches Entity-Linking für historische TEI-Editionen tei-llm.histomatiker.de/ #GND #LLM #NER #TEI #Wikidata Eine KI-gestützte Pipeline zur automatischen Verknüpfung von Personen, Orten und Organisationen in TEI-XML-Registern mit Normdaten aus der Gemeinsamen Normdatei (GND) und Wikidata. Entwickelt für die Anforderungen frühneuzeitlicher und antiker Editionsprojekte.

  5. Bookmarked: TEI-NER Pipeline — Automatisches Entity-Linking für historische TEI-Editionen tei-llm.histomatiker.de/ #GND #LLM #NER #TEI #Wikidata Eine KI-gestützte Pipeline zur automatischen Verknüpfung von Personen, Orten und Organisationen in TEI-XML-Registern mit Normdaten aus der Gemeinsamen Normdatei (GND) und Wikidata. Entwickelt für die Anforderungen frühneuzeitlicher und antiker Editionsprojekte.

  6. Почему WER недостаточно: Семантическая декомпозиция ошибок ASR

    В продуктах, построенных поверх моделей распознавания речи (Automatic Speech Recognition models, ASR), качество распознавания речи напрямую влияет на пользовательский опыт. О том, какие есть методы оценки качества таких моделей, какие у них ограничения и как мы измеряем качество их работы — и пойдет речь.

    habr.com/ru/articles/1043102/

    #wer #asr #ner #nlp #речевые_технологии #распознавание_речи #whisper #машинное_обучение #Оценка_качества_моделей #речь_в_текст

  7. 2/5 Was steht auf d Spiel? ✅ Ende d Löschmechanismus in der Marktstabilitätsreserve (#MSR) ✅ Verringerung des linearen Reduktionsfaktors (#LRF) – der Taktgeber für Emissionsreduktion ✅ Versteigerung von Zertifikaten aus d „Reserve für neue Marktteilnehmer“ (#NER) für d industrielle Dekarbonisierung

  8. Как решать задачу NER на практике

    Рассказываю, как на практике решать задачу NER. На примере извлечения сущностей из резюме пройдём путь от разметки данных до работающего API. Меньше теории, больше практики. 🔥 Начинаем 🔥

    habr.com/ru/articles/1023552/

    #NER #NLP #bert #natural_language_processing #python #как_решать_задачу_ner

  9. 📣 Vortrag: Holle Meding (@hmeding) & Aurel Daugs (Digital History Berlin) sprechen bei der DHd AGKI-DH über #LLMs in der historischen Forschung.

    🗓 13.04.2026 | 11:30–12:30 Uhr
    💻 Zoom: uni-graz.zoom.us/j/69588616456

    Im Fokus stehen: Potenziale & Grenzen von LLMs – u. a. #Chronosensitivität, #Bias, #Alignment & #Opazität.
    Mit Beispielen: #NER zur Analyse von TikTok-Inhalten & #RAG auf Basis historischer Zeitungen.

    #DigitalHumanities #DigitalHistory #LLM #DHd #Openaccess

  10. 📣 Vortrag: Holle Meding (@hmeding) & Aurel Daugs (Digital History Berlin) sprechen bei der DHd AGKI-DH über #LLMs in der historischen Forschung.

    🗓 13.04.2026 | 11:30–12:30 Uhr
    💻 Zoom: uni-graz.zoom.us/j/69588616456

    Im Fokus stehen: Potenziale & Grenzen von LLMs – u. a. #Chronosensitivität, #Bias, #Alignment & #Opazität.
    Mit Beispielen: #NER zur Analyse von TikTok-Inhalten & #RAG auf Basis historischer Zeitungen.

    #DigitalHumanities #DigitalHistory #LLM #DHd #Openaccess

  11. Как маскировать персональные данные на изображениях: наш эксперимент с OCR и NER

    Всем привет! Меня зовут Андрей Иванов, я NLP-исследователь в R&D red_mad_robot. Мы разрабатываем систему Guardrails для защиты персональных данных (PII) и фильтрации небезопасного контента. В этой статье расскажу, как мы решали задачу точечного маскирования PII на картинках без обучения специальных визуальных детекторов. Разберём связку оптического распознавания символов (OCR) с NER-моделью, покажем метрики на реальных данных, раскроем ограничения подхода и наши решения для их преодоления.

    habr.com/ru/companies/redmadro

    #ai #llm #ocr #ner #pii #computer_vision #маскирование_данных #обработка_изображений #nlp #rnd

  12. Our paper "NERdME: a Named Entity Recognition Dataset for Indexing Research Artifacts in Code Repositories" by @GenAsefa Zongxiong Chen, @shufan Mary Ann Tan, Zhaotai Liu, @sonjas0815 & @lysander07 was accepted at The ACM Web Conference 2026.
    ...as it is still not sure whether WWW2026 will take place (in Dubai) we published the paper already in #arxiv

    arxiv.org/abs/2603.05750

    #AI #NER #NLP #researchdatamanagement @NFDI4DS @fiz_karlsruhe #semanticweb

  13. Our paper "NERdME: a Named Entity Recognition Dataset for Indexing Research Artifacts in Code Repositories" by @GenAsefa Zongxiong Chen, @shufan Mary Ann Tan, Zhaotai Liu, @sonjas0815 & @lysander07 was accepted at The ACM Web Conference 2026.
    ...as it is still not sure whether WWW2026 will take place (in Dubai) we published the paper already in #arxiv

    arxiv.org/abs/2603.05750

    #AI #NER #NLP #researchdatamanagement @NFDI4DS @fiz_karlsruhe #semanticweb

  14. Сравнение RuModernBERT и multilingual-e5-base для NER на русском

    Однажды при мне два ИИ экcперта закусились на тему какая модель лучше извлекает именованные данные на русском языке: RuModernBERT или multilingual-e5-base. Я послушал их аргументы и решил поставить небольшой эксперимент на реальных данных (благо данных хоть отбавляй). Итак, условия NER задачи:

    habr.com/ru/articles/1006998/

    #ner #e5 #rumodernbert

  15. Wrote an article and published a nuget package sitting here in the hospital. mostlylucid.net/blog/simple-oc
    (RDP over tailscale rules 🤓)
    Companion CLI and nuget packages linked at the top. Makes OCR & Named Entity Extraction SUPER EASY.

    #ocrr #llm #ner

  16. Wrote an article and published a nuget package sitting here in the hospital. mostlylucid.net/blog/simple-oc
    (RDP over tailscale rules 🤓)
    Companion CLI and nuget packages linked at the top. Makes OCR & Named Entity Extraction SUPER EASY.

    #ocrr #llm #ner

  17. NER не про токены: почему span важнее BIO

    NER часто воспринимают как задачу классификации токенов: BIO-теги, последовательности меток, декодирование. Такой взгляд удобен с точки зрения моделей, но плохо отражает то, как NER работает в реальных системах. Сущности - это не токены, а фрагменты текста. Результаты работы NER-систем, как правило, представлены в виде спанов - с явными границами начала и конца (start / end) и типами сущностей. В этой статье мы разберём два уровня разметки в NER: span-level и token-level и покажем, какую роль каждый из них играет в практических пайплайнах.

    habr.com/ru/companies/raft/art

    #ner #named_entity_recognition #аннотация_данных #машинное+обучение #machine_learning #nlp #span #token #персональные_данные #pii

  18. #news ⚡ Dax startet deutlich im Minus – Nervosität wegen Grönland-Debatte: Der Dax ist am Dienstag mit deutlichen Verlusten in den Handelstag gestartet. Gegen 9:30 Uhr wurde der deutsche Leitindex mit rund 24.... hubu.de/?p=311245 | #dax #groenlanddebatte #minus #ner

  19. Problem: we keep using frontier LLMs as glue for jobs that are already solved.

    Solution: run OCR + NER locally in C# with ONNX Runtime. Deterministic extraction on ingest. Store the entities. Use an LLM later only if you actually need synthesis.

    OCR with Tesseract, then BERT NER via ONNX in .NET. No Python, no cloud, no tokens.

    This is my 'for beginners' article. I'm DEEP in OCR but realised I never explained the quickest way to do this *locally*.

    mostlylucid.net/blog/simple-oc

    #CSharp #DotNet #ONNX #OnnxRuntime #OCR #NER #LocalAI #RAG #DocumentAI

  20. Problem: we keep using frontier LLMs as glue for jobs that are already solved.

    Solution: run OCR + NER locally in C# with ONNX Runtime. Deterministic extraction on ingest. Store the entities. Use an LLM later only if you actually need synthesis.

    OCR with Tesseract, then BERT NER via ONNX in .NET. No Python, no cloud, no tokens.

    This is my 'for beginners' article. I'm DEEP in OCR but realised I never explained the quickest way to do this *locally*.

    mostlylucid.net/blog/simple-oc

    #CSharp #DotNet #ONNX #OnnxRuntime #OCR #NER #LocalAI #RAG #DocumentAI

  21. Talán hallottatok róla, hogy a Tisza lefoglalta a biztosvalasztas.hu domaint.

    A biztosvalasztas.ru még szabad volt.

    Már nem az 😂

    #magyarpolitika #magyarország #kampány #fidesz #tisza #ner #politika

  22. Built a cybersecurity NER model. 13 entity types. 1,500+ security entities. It's on HuggingFace.

    Spent months extracting and annotating cybersecurity entities from real job postings, threat reports, and compliance docs. Turning it into a tool anyone can use.

    What it extracts:
    - Security roles (CISO, SOC Analyst, Pen Tester)
    - Certifications (CISSP, OSCP, CEH)
    - Tools (Splunk, CrowdStrike, Metasploit)
    - Threats (APT, ransomware, phishing)
    - Attack techniques (SQLi, XSS, RCE)
    - CVEs, frameworks (MITRE ATT&CK, NIST), regulations (GDPR, PCI-DSS)
    - Technical skills, acronyms, compliance terms

    Built for:
    - Threat intel parsing
    - Security talent matching
    - Skills inventory extraction
    - Compliance doc analysis

    The tech:
    - RoBERTa transformer, domain-adapted on 40K security texts
    - spaCy pipeline for easy integration
    - 69% F1 score (and improving)

    Where I need help:
    - More annotated security text (CVs, job posts, threat reports)
    - Edge cases the model misses
    - Ideas for entity types I haven't covered

    Model: huggingface.co/pki/cybersec-ne

    #cybersecurity #NER #NLP #infosec #opensource

  23. Автоматизация обработки ТI-отчетов с помощью NER: как мы сэкономили время аналитиков

    Привет, Хабр! Меня зовут Виктор Пронин, я старший аналитик киберугроз в центре компетенций группы компаний «Гарда». Мы формируем для Гарда Threat Intelligence Feeds данные об угрозах на основе обезличенной телеметрии из наших инсталляций, а для получения более полной картины обращаемся, в том числе, и к информации из открытых источников. В статье я расскажу об автоматизированной обработке публикаций по информационной безопасности. Кейс будет полезен аналитикам киберугроз и специалистам, интересующимся применением ML в ИБ.

    habr.com/ru/companies/garda/ar

    #threat_intelligence #NER #обработка_текстов #искусственный_интеллект #ml

  24. ChamelOn: как мы создали production-ready систему анонимизации ПД с защитой от ReDoS и 95% точностью

    Команда AI Dev Team разработала ChamelOn за 3 месяца как реальный заказ от клиента — крупного колл-центра с тысячами записей разговоров в день. Система уже работает в production на реальных клиентских проектах.

    habr.com/ru/articles/969766/

    #анонимизация #персональные_данные #gdpr #фз152 #typescript #nodejs #nextjs #re2 #ml #ner

  25. Как я пытался подружить PHP с NER — драма в 5-ти актах

    Это статья - пример небольшого личного опыта, где я пытался решить одну чисто техническую задачу для одного из моих текущих проектов. Задача в конце-концов была решена, насколько правильно - не знаю, но, надеюсь, многим будет интересен и полезен мой опыт. Итак, небольшая драма в 5-ти актах.

    habr.com/ru/articles/948014/

    #php #ner #named_entity_recognition #nlpмодели #nlp_обработка_текста #nlp4code

  26. Кофе — мой type, музыка — мой out: строим NERвный-пайплайн на продуктовых запросах

    Привет, Хабр! На связи команда Ad-Hoc аналитики X5 Tech. В этой статье расскажем, как мы научили поиск извлекать важные сущности из запросов пользователей. Полный разбор реализации NER (Named Entity Recognition) для продуктового ритейла, шаг за шагом: как мы размечали данные, считали метрики на уровне токенов и сущностей — и почему для коротких и длинных запросов потребовались разные архитектурные решения.

    habr.com/ru/companies/X5Tech/a

    #ner #ии #искусственный_интеллект #машинное_обучение #nlp #трансформеры

  27. [LangExtract](developers.googleblog.com/en/i) has got me curious, but I don't get what makes it different from a [spacy-llm/prodigy](prodi.gy/docs/large-language-m) setup. Is it just that I am spared the effort of chunking long input and/or constructing output JSON from entities and offsets by writing the corresponding python code myself?...

    Ah, one more difference is that langextract is #OpenSource whereas prodigy is not (?). (On the other hand, prodigy has a better integration with a correction+training workflow.)

    #llm #google #langextract #nlp #spacy #prodigy #ner

  28. [LangExtract](developers.googleblog.com/en/i) has got me curious, but I don't get what makes it different from a [spacy-llm/prodigy](prodi.gy/docs/large-language-m) setup. Is it just that I am spared the effort of chunking long input and/or constructing output JSON from entities and offsets by writing the corresponding python code myself?...

    Ah, one more difference is that langextract is #OpenSource whereas prodigy is not (?). (On the other hand, prodigy has a better integration with a correction+training workflow.)

    #llm #google #langextract #nlp #spacy #prodigy #ner

  29. Что такое NER, зачем он нужен и когда не поможет

    Про NER написано немало, но этот материал носит прикладной характер. Статья будет полезна тем, кто интересуется NLP и ищет разные подходы для решения узкопрофильных задач, требующих извлечения сущностей из текста. Для джунов это возможность пройти весь путь — от разметки данных до обучения собственной кастомной NER-модели, попутно понять типичные сложности и ограничения. Привет, меня зовут Александр Агеев, на протяжении года я занимался NER-моделями для определения сущностей на этикетках продуктов питания. Несмотря на мою любовь к NER, у этой технологии есть свои границы — кейсы, которые она не может решить хорошо, поэтому надо подключать другие инструменты. В статье я дам критерии применимости NER для решения практических задач.

    habr.com/ru/articles/921698/

    #нейросети_python #named_entity_recognition #ner #natural_language_processing #nlp #spacy #примеры_кода #обучение_моделей

  30. Also presented at #dae2025 : a research platform developed by Dariah PL for uploading, annotating, enriching and sharing #humanities data. The platform also allows collaborations. Interesting features are embedded #OCR and #NER functionalities. Find out more: lab.dariah.pl/en/

  31. Also presented at #dae2025 : a research platform developed by Dariah PL for uploading, annotating, enriching and sharing #humanities data. The platform also allows collaborations. Interesting features are embedded #OCR and #NER functionalities. Find out more: lab.dariah.pl/en/

  32. От хаоса к порядку: как ML помогает искать и защищать конфиденциальную информацию

    В современном мире объемы данных растут экспоненциально: компании ежедневно генерируют и обрабатывают огромные массивы информации — от реляционных баз данных и текстовых документов до изображений, аудио и видео. С ростом объемов информации усложняется и ее защита, особенно в отношении чувствительных сведений: персональных данных сотрудников и клиентов, финансовой информации, корпоративных документов и других конфиденциальных материалов. Традиционные методы обнаружения и классификации информации, основанные на формальной экспертизе и регулярных выражениях, демонстрируют ограниченную эффективность: они неплохо работают для стандартных форматов, таких как email-адреса и банковские карты, но могут не покрывать с должной полнотой обнаружение в реальных сценариях. На помощь приходит машинное обучение, позволяющее автоматизировать процесс классификации, учитывать контекст и работать с разными источниками информации. Меня зовут Вадим Безбородов. Мы c Максимом Митрофановым в департаменте Data science & ML в Positive Technologies занимаемся исследованием и внедрением машинного обучения в продукты компании. В этой статье расскажем о наших исследованиях и внедрении ML в модуль поиска и классификации чувствительных данных в PT Data Security. Читать

    habr.com/ru/companies/pt/artic

    #машинное_обучение #обработка_естественного_языка #персональные_данные #информационная_безопасность #named_entity_recognition #machine_learning #nlp #data_security #защита_данных #ner

  33. Cool.....coolcoolcoool

    - 13min Umstieg in NN
    - pünktlich ab in #NER
    - S-Bahn voraus
    - +4 an #NF

    - ein Gz überholt
    - ein ICE überholt

    - +11 ab #NF 😤

  34. Stelle 3/5

    Für das Projekt „TextPloring. Forschungsdatenexploration in den Geisteswissenschaften mit dem LAUDATIO-Repository“ suchen wir befristet auf 2 Jahre ein*e #WiMi (65%) für die Modellierung mittelalterlicher Städtechroniken, Integration in das #LAUDATIO Repositorium & eigenständiger Beforschung der Daten mit #DigitalHistory Methoden.

    In diesem Rahmen besteht die Möglichkeit zur Entwicklung eines Promotionsprojekts.

    👉 dhistory.hypotheses.org/10656

    #DH #Mediävistik #NER #LLM #DHJobs
    4/6

  35. 📢 Wir stellen ein! 📢

    Am Lehrstuhl für Digital HIstory der @HumboldtUni bzw. verbundenen Drittmittelprojekten sind über den Sommer 5 Stellen zu besetzen!

    Mehr Details zu den Stellen und zur Bewerbung gesammelt auf unserem Blog... 👉 dhistory.hypotheses.org/10656

    ...oder im Kurzformat hier im Thread. 👇

    @histodons @historikerinnen
    #DH #DigitalHistory #NFDI #DHJobs #WiMi #RSE #InfoWiss #WissKomm #OER #NER #LLM #Mediävistik
    1/6

  36. 📖 #NLP people, a reminder that the brilliant notebooks developed by #Ghent CDH are a game-changing walkthrough of #NER, #ABSA Sentiment Analysis, and #RelationalExtraction pipelines. ▶️
    Please share widely!
    github.com/GhentCDH/CLSinfra/t

  37. #til the German transformer model for #spacy is not trained for #ner. Room for improvement, I'd say.

  38. 📖 three CLS INFRA Deliverables on #NLP are out now! 📖
    In this video Tess Dejaghere and Pranaydeep Singh of Ghent University CDH explain and demo work on #NER (#NamedEntityRecognition), #ABSA (Aspect-based #SentimentAnalysis) and #RelationalExtraction.
    youtu.be/RJE83eb7a6A

  39. Canada ist ein Pferd - @bibwiss hat die besten Beispiele für Unsicherheit /Uncertainty bei Named Entity Recognition :) #NER #DHd2025

  40. 🔠 Panel: More than Chatbots: Multimodal Large Language Models in Humanities Workflows

    At #DHd2025, Nina Rastinger explores how well #AI handles abbreviations & NER:

    ✅ NER works well, even with small, low-cost models
    ❌ Abbreviations are tricky—costs & resource demands skyrocket
    🚀 GPT o1 improves performance, even on abbreviations, but remains resource-intensive
    Balancing accuracy & efficiency in text processing remains a challenge! ⚖️

    #AI #NER #TextProcessing #DigitalHumanities

  41. 🥁 We are happy to announce that we just published our first preprint on arXiv: "NER4all or Context is All You Need: Using LLMs for low-effort, high-performance NER on historical texts. A humanities informed approach".🎉

    👉 arxiv.org/abs/2502.04351 👈

    It is also our first endevour into collaborative work with such a large number of collaborators & contributors from the Chair of Digital History, NFDI4Memory's Methods Innovation Lab, & AI-Skills.

    #DigitalHistory #NER #LLM #AI #DigitalHumanities

  42. ReadMe2KG: Github ReadMe to Knowledge Graph #Challenge has been published as part of the Natural Scientific Language Processing and Research Knowledge Graphs #NSLP2025 workshop co-located with #eswc2025. This #NER task aims to complement the NDFI4DataScience KG via information extraction from GitHub README files.

    task description: nfdi4ds.github.io/nslp2025/doc
    website: codabench.org/competitions/539

    @eswc_conf @GenAsefa @shufan @NFDI4DS #NFDIrocks #knowledgegraphs #semanticweb #nlp #informationextraction

  43. Found just what I needed. Unfortunately it seems abandoned and requires old versions of a bunch of stuff. Sigh. #ner #TurkuNLP