Wie benutze ich DAKODA?

Um mit der DAKODA‑Infrastruktur zu arbeiten, bieten sich verschiedene Zugänge an. Sie können sich zunächst über das DAKODA‑Dashboard und das Repositorium einen Überblick über geeignete Korpora verschaffen. Mit den DAKODA‑Annotationen und den originalen Annotationen sowie Metadaten können Sie eigene Fragestellungen bearbeiten. Die Jupyter‑Notebooks liefern Anleitungen zur Datenanalyse, die Sie korpusübergreifend anwenden können. Außerdem können Sie die Spezifikationen des DAKODA‑Projekts zur manuellen Annotation von Erwerbsstufen auf Ihre eigenen Korpusdaten anwenden.

Korpusübergreifende Analysen

Wenn Sie eine eigene Fragestellung mit einer korpusübergreifenden Analyse bearbeiten möchten und geeignete Korpusdaten suchen, können Sie mithilfe des Repositoriums passende Korpora in unterschiedlichen Formaten herunterladen.

  1. Gehen Sie ins Repositorium.
  2. Sie können in den Filtereinstellungen auswählen, ob Sie nach einzelsprachlichen Korpora (mono) – etwa dem Beldeko‑Korpus oder dem CDLK‑Korpus – oder nach mehrsprachigen Korpora (multi) filtern möchten. Weiter können Sie nach Modalität (gesprochen oder geschrieben) und nach GER‑Niveaus filtern.
  3. Nachdem Sie Ihre Auswahl getroffen haben, gehen Sie zurück ins Repositorium und laden die Daten über das Download‑Symbol im gewünschten Format herunter. Für die weitere Analyse empfiehlt sich Python > 3.11 < 3.14.

Achtung: Die Zuweisung der GER‑Niveaus in den originalen wie auch in den DAKODA‑Metadaten beruht auf unterschiedlichen Kriterien. Teilweise fehlen Informationen zum GER‑Niveau, oder das Korpus deckt ein breites Niveau‑Spektrum ab. Eine zu starke Eingrenzung kann daher zu einer stark eingeschränkten Korpusauswahl führen.

Unsicher, ob die Korpusdaten zu Ihrer Fragestellung passen? Nutzen Sie das Dashboard, um Lernendentexte mit Metadaten per Zufallsauswahl zu betrachten. Geben Sie im Suchfeld einen Variablennamen ein, um passende Metadaten zu finden. Das Metadaten‑Schema steht als .xlsx‑Download bereit. Links zu Originalkorpusseiten und Handbüchern erleichtern das Kennenlernen.

Dateiformate

Als Downloadoptionen im Repositorium stehen Ihnen folgende Formate zur Verfügung:

  • .xmi – Extensible Metadata Interchange, enthält Original‑ und DAKODA‑Annotationen. Öffnen Sie die Dateien z. B. mit dem SimpleXmiViewer. Für weitere Analysen empfiehlt sich Python.
  • .txt – Lernendentexte mit automatisch generierten Zielhypothesen; Metadaten sind beigefügt.
  • JSON‑Zip – harmonisierte Metadatenwerte nach dem DAKODA‑Metadatenschema (unter „meta“ im Dropdown‑Menü).
  • TEI (XML) – strukturiertes, reich annotiertes Format für weiterführende Analysen.
  • .exb – für Annotationen im EXMARaLDA‑Partitur‑Editor oder im Corpus‑Manager.

Datenanalyse

Arbeiten Sie mit den Korpusdaten in einem Jupyter‑Notebook, können Sie unsere vorbereiteten Analyse‑Rezepte ausprobieren und eigene Analysen durchführen. Die README im GitHub‑Repository enthält alle Schritte zum Starten der Notebooks. Jeder Schritt ist im Notebook kommentiert.

Benötigt werden mindestens Python 3.11 und die Poetry‑Umgebung (maximal Python 3.13). Alternativ ist der pip‑Installer möglich. Das DAKODA‑core‑Repository liefert alle notwendigen Instanzen für die Jupyter‑Umgebung.

Nach der Installation erscheint im Terminal ein Access‑Token, das im Jupyter‑Lab‑Browser‑Fenster eingegeben werden muss. Anschließend stehen die verfügbaren Notebooks zur Ansicht bereit oder Sie können ein neues Notebook für eigene Analysen starten.