home.social

#corpusexplorer — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #corpusexplorer, aggregated by home.social.

fetched live
  1. CorpusExplorer (Update Q4 2025)

    CorpusExplorer – Releasenotes Q4 / 2025

    Wichtige Neuerungen

    Überarbeitete Zeitverlaufs-Analysen

    Die Analyse über Zeitverläufe wurde grundlegend überarbeitet und flexibler gestaltet:

    • Datentyp unabhängige Zeitangaben: Es ist nun nicht mehr erforderlich, dass Zeitangaben explizit als Datumstyp vorliegen. Ob String, Ganzzahl oder Datum – entscheidend ist nur, dass die Angabe auf ein interpretierbares Datum (z. B. Jahreszahl oder konkretes Datum) verweist.

    • Wegfall der automatischen Clusterung: Statt einer Cluster-basierten Unterteilung werden nun alle Zeitpunkte im Datensatz direkt auf dem Zeitstrahl ausgegeben.

    • Neue Cluster-Optionen: Über die Einstellung „Cluster“ kann die Ausgabe bei Bedarf in verschiedene Zeitauflösungen zusammengefasst werden:

      • tageweise

      • monatsweise

      • quartalsweise

      • jahresweise

      • jahrzehntweise

      ⚠️ Hinweis: Bei Korpora mit vielen Dokumenten kann eine tageweise Darstellung zu langen Berechnungszeiten führen (viele Tage = viele Datenpunkt => lange Berechnung). In solchen Fällen empfiehlt sich die Einstellung „Jahr“ (reduziert die Anzahl der Datenpunkte um den Faktor 365).

    Verbesserungen

    • I5-XML-Verarbeitung: Verbesserte Stabilität und höhere Kompatibilität beim Einlesen und Verarbeiten von I5-XML-Daten.

    • CorpusMerger-Erweiterung für Entwickler*innen:
      Der CorpusMerger unterstützt nun Transformationen während des Merge-Prozesses (on-the-fly).
      Aktuell verfügbar:

      • Umwandlung des gesamten Textes in lower-case.
        Weitere Normalisierungen folgen in kommenden Versionen.

    ️ Fehlerbehebungen

    • Diverse kleinere Bugs wurden behoben und die allgemeine Performance verbessert.

    #2025 #Chart #CorpusExplorer #Q4 #Update #Zeitreihen

  2. CorpusExplorer (Update Q3 2025)

    Dieses Update umfasst nur kleinere Korrekturen und Fehlerbehebungen. Größere Neuerungen werden dann in Q4 2025 folgen.
    Genießt den Sommer

    #2025 #CorpusExplorer #Q3

  3. CorpusExplorer (Update Q1 2025)

    Das erste Quartals-Update (Q1) für 2025 bringt folgende Neuerungen und Verbesserungen:

    • Verbesserung der Performance für verschiedene Volltext-Filter/Suchen. Insbesondere für exakte und flexible Phrasen.
    • Filter um Multi-Layer NGramme selektiv zu filtern.
    • Die Analysen zur „Zeitlichen Verteilungen“ sind jetzt mit mehreren Datums-Formaten kompatibel.
    • Neue Möglichkeit über die Konsole, selektiv nach korrespondieren Layer-Werten zu suchen.
    • Fix für das Problem, falls die CorpusExplorerConsole (cec) auf einem Multi-User Linux System (z. B. auch Cluster) von mehreren Personen gleichzeitig verwendet wird.

    #2025 #CorpusExplorer #Q1 #Update

  4. CorpusExplorer (Update Q4 2024)

    So, das letzte Update für dieses Jahr. Ich wünsche euch schon einmal frohe Feiertage und einen guten Start ins Jahr 2025. Folgende Neuerungen / Änderungen und Verbesserungen gibt es:

    • Salt-XML kann jetzt direkt importiert werden. Eine Installation von Salt&Pepper (Addon) ist dafür nicht mehr nötig. Das Addon wird es aber weiterhin geben, da es Transformationen und Importe aus anderen Formaten ermöglicht.
    • Alle Komponenten setzen jetzt das .NET-Framework 4.8 voraus. Unnötige Abhängigkeiten wurden entfernt und der Code wurde bereinigt.
    • (Teilweise) Unterstützung von DraCor-XML. Leider sind die XML-Daten sehr unterschiedlich, sodass eine vollständige Unterstützung noch etwas dauert.
    • TreeTagger-Anpassung. Weiterhin wird der TreeTagger als Standard ausgeliefert (an der Stelle erneut ein großes Dankeschön an Helmut Schmid). Die Sprachen Deutsch, Englisch, Französisch, Italienisch, Spanisch, Niederländisch und Polnisch gehören zu den Standardsprachen. Der TreeTagger entwickelt sich aber wie der CorpusExplorer immer weiter. So gibt es mittlerweile eine Reihe von neuen Sprachen. Aktuell können diese manuell nachinstalliert werden (Anleitung auf Anfrage) – ich plane aber für kommendes Jahr eine automatische (bedarfsabhängige und automatische) Installation.
    • Es gibt neue Consolen-Befehle:
      • frequency1-per-document – zählt die Token-Frequenz auf einem Layer pro Dokument.
      • frequency1-per-sentence- zählt die Token-Frequenz auf einem Layer pro Satz.
      • crossfrequency-select – zählt die Kreuz-Frequenz für einen gegebenen Begriff.
      • crossfrequency-select-range – zählt die Kreuz-Frequenz für einen gegebenen Begriff innerhalb eines Range (Token vor/nach Begriff).
      • burrows-delta – Berechnet Burrows-Delta.
      • cooccurrence-classic – Der CorpusExplorer berechnet Kookkurrenzen innerhalb eines Satzes. Mit diesem Befehl ist es möglich, Kookkurrenzen wie bei alternativer Software üblich innerhalb eines Range (Token vor/nach Suchbegriff) zu berechnen.
      • cooccurrence-diversity – Berechnet die Diversität der Kookkurrenzen.
      • corpus-fsm – Erstellt eine Finite-State-Machine für ein Korpus bzw. dessen Metadaten. z. B. um im Zeitverlauf Autor*innen zu identifizieren, die für einen oder mehrere Verlage arbeiten.
      • ngram-char – Berechnet N-Gramme auf Zeichen-Level.
      • reading-ease – Berechnet Lesbarkeitsmetriken.
      • skipgram – Berechnet ein Skipgram-Modell.
      • term-documet-matrix – Berechnet eine Term-Dokumenten-Matrix
    • Fehler behoben: Bei einigen CorpusExplorer-Installationen wurden die verfügbaren Addons und „direkt verfügbare Korpora“ nicht korrekt angezeigt. Der Fehler wurde behoben. Evtl. braucht es einen Neustart nach dem Update.
    • Fehlerkorrekturen und allgemeine Verbesserungen.

    #Console #CorpusExplorer #DraCor #SaltXML #TreeTagger

  5. Reading of #VoyantTools recently (👋🏻 @felwert ), would you prefer to have a corpus with un-normalized historical spelling variants or rather one with only the lemmatized tokens? We have a mechanism for lemmatizing, but not for "just" normalizing, so this option is not viable for us in the salamanca.school project.

    Perhaps @dta_cthomas can you share some experiences with offering both?

    Second question: do you know of alternative "distant reading" visualization tools/libraries/platforms to integrate into a (headless) corpus/collection website? (Without trying, I suppose this excludes some visualization-capable corpus analysis apps like #TXM or #CorpusExplorer, but I'd be happy to be proven wrong.)

  6. Reading of #VoyantTools recently (👋🏻 @felwert ), would you prefer to have a corpus with un-normalized historical spelling variants or rather one with only the lemmatized tokens? We have a mechanism for lemmatizing, but not for "just" normalizing, so this option is not viable for us in the salamanca.school project.

    Perhaps @dta_cthomas can you share some experiences with offering both?

    Second question: do you know of alternative "distant reading" visualization tools/libraries/platforms to integrate into a (headless) corpus/collection website? (Without trying, I suppose this excludes some visualization-capable corpus analysis apps like #TXM or #CorpusExplorer, but I'd be happy to be proven wrong.)

  7. Reading of #VoyantTools recently (👋🏻 @felwert ), would you prefer to have a corpus with un-normalized historical spelling variants or rather one with only the lemmatized tokens? We have a mechanism for lemmatizing, but not for "just" normalizing, so this option is not viable for us in the salamanca.school project.

    Perhaps @dta_cthomas can you share some experiences with offering both?

    Second question: do you know of alternative "distant reading" visualization tools/libraries/platforms to integrate into a (headless) corpus/collection website? (Without trying, I suppose this excludes some visualization-capable corpus analysis apps like #TXM or #CorpusExplorer, but I'd be happy to be proven wrong.)

  8. Reading of #VoyantTools recently (👋🏻 @felwert ), would you prefer to have a corpus with un-normalized historical spelling variants or rather one with only the lemmatized tokens? We have a mechanism for lemmatizing, but not for "just" normalizing, so this option is not viable for us in the salamanca.school project.

    Perhaps @dta_cthomas can you share some experiences with offering both?

    Second question: do you know of alternative "distant reading" visualization tools/libraries/platforms to integrate into a (headless) corpus/collection website? (Without trying, I suppose this excludes some visualization-capable corpus analysis apps like #TXM or #CorpusExplorer, but I'd be happy to be proven wrong.)

  9. Reading of #VoyantTools recently (👋🏻 @felwert ), would you prefer to have a corpus with un-normalized historical spelling variants or rather one with only the lemmatized tokens? We have a mechanism for lemmatizing, but not for "just" normalizing, so this option is not viable for us in the salamanca.school project.

    Perhaps @dta_cthomas can you share some experiences with offering both?

    Second question: do you know of alternative "distant reading" visualization tools/libraries/platforms to integrate into a (headless) corpus/collection website? (Without trying, I suppose this excludes some visualization-capable corpus analysis apps like #TXM or #CorpusExplorer, but I'd be happy to be proven wrong.)