γενικό υπόβαθρο · εξειδίκευση · Ανάπτυξη Δεξιοτήτων

Επεξεργασία φυσικής γλώσσας για το Βυζαντινό Σώμα Κειμένων

Μεταπτυχιακό Πρόγραμμα — Επίπεδο 7

10 Πιστωτικές Μονάδες ECTS
3 ώρες / εβδομάδα
Γλώσσα Αγγλική
Ανοιχτό σε Erasmus
Χωρίς Προαπαιτούμενα

ΜΑΘΗΣΙΑΚΑ ΑΠΟΤΕΛΕΣΜΑΤΑ

Μετά την ολοκλήρωση του μαθήματος, οι φοιτητές θα είναι σε θέση να:

1)

Εξηγήσουν τις βασικές έννοιες της NLP (τοκενοποίηση, λεμματοποίηση, αναγνώριση ονοματικών οντοτήτων, ταξινόμηση κειμένων, μοντελοποίηση θεμάτων) και τη σημασία τους για τη βυζαντινή φιλολογία και την ιστορική έρευνα

2)

Χρησιμοποιούν τη γλώσσα Python και τις τυπικές βιβλιοθήκες επεξεργασίας φυσικής γλώσσας (CLTK, spaCy, NLTK, pandas) για τη φόρτωση, την προεπεξεργασία και την ανάλυση βυζαντινών ελληνικών κειμένων από τα κυριότερα ψηφιακά αποθετήρια

3)

Σχεδιάζουν και να εφαρμόζουν κατευθυντήριες γραμμές επισημάνσεων για βυζαντινές ονοματικές οντότητες (πρόσωπα, αξιώματα, τοπωνύμια, δυναστείες, ημερομηνίες) και να δημιουργούν επισημασμένα σύνολα δεδομένων χρησιμοποιώντας τα εργαλεία Prodigy ή Label Studio

4)

Να εκπαιδεύουν, να αξιολογούν και να ερμηνεύουν κριτικά ένα μοντέλο NER ειδικού τομέα χρησιμοποιώντας τους δείκτες ακρίβειας, ανάκλησης και F1

5)

Να εφαρμόζουν μεθόδους στιλομετρικής ανάλυσης και μοντελοποίησης θεμάτων σε βυζαντινά σώματα κειμένων και να ερμηνεύουν τα αποτελέσματα στο ιστορικό και φιλολογικό τους πλαίσιο

6)

Αξιολογούν κριτικά τις δυνατότητες και τους περιορισμούς των μεγάλων γλωσσικών μοντέλων και των εργαλείων τεχνητής νοημοσύνης, όταν εφαρμόζονται σε μεσαιωνικά ελληνικά κείμενα

7)

Σχεδιάσουν και να υλοποιήσουν ένα ολοκληρωμένο έργο επεξεργασίας φυσικής γλώσσας (NLP) με βάση ένα βυζαντινό κείμενο, συνδυάζοντας τη φιλολογική εμπειρογνωμοσύνη με υπολογιστικές μεθόδους

ΠΡΟΓΡΑΜΜΑ ΜΑΘΗΜΑΤΟΣ

13 Ενότητες

Εβδομάδα 01 | Επεξεργασία Κειμένου στη Python

Ψηφιακοί πόροι για βυζαντινά κείμενα.

Φόρτωση βυζαντινών κειμένων, βασικές λειτουργίες με συμβολοσειρές.

Τοκενοποίηση, κανονικοποίηση, πολυτονικό Unicode, γραφικές συντομογραφίες. Εργαλεία: NLTK, spaCy, CLTK.

Οι προκλήσεις της ελληνικής κλίσης· αξιολόγηση του CLTK σε βυζαντινά κείμενα.

Συχνότητα λέξεων, νόμος του Zipf, ανάλυση συγγραφικής ταυτότητας εφαρμοσμένη σε βυζαντινά κείμενα.

Τύποι οντοτήτων στα βυζαντινά κείμενα· γιατί αποτυγχάνει η έτοιμη λύση NER· σύστημα επισήμανσης IOB.

Σχεδιασμός κατευθυντήριων γραμμών για την επισημείωση βυζαντινών οντοτήτων.

Δείκτες αξιολόγησης: ακρίβεια, ανάκληση, F1. Ανάλυση σφαλμάτων.

Ταξινόμηση ανά είδος. Κριτική ερμηνεία.

Σύνδεση οντοτήτων με τα PBW, Pleiades, Wikidata· εισαγωγή στα τρίπλετα RDF.

Στρατηγικές υποβολής ερωτήσεων· κριτική αξιολόγηση της απόδοσης των μοντέλων μεγάλης γλώσσας (LLM) στα μεσαιωνικά ελληνικά· παραπληροφόρηση σε ιστορικά πλαίσια.

Παρουσιάσεις των φοιτητών σχετικά με την πρόοδο της διαδικασίας NER· ανατροφοδότηση από τους συμφοιτητές· επίλυση προβλημάτων.

Τελική συζήτηση: υπολογιστική ανάλυση κειμένων στη βυζαντινή επιστήμη.

ΑΞΙΟΛΟΓΗΣΗ

Αξιολόγηση φοιτητών

40%

Εβδομαδιαίες ασκήσεις

διαμορφωτική αξιολόγηση· υποβάλλεται μέσω της πλατφόρμας του μαθήματος· βαθμολογείται με βάση την ορθότητα, την ποιότητα του κώδικα και την κριτική ανάλυση

60%

Τελική Εργασία
συνολική αξιολόγηση· διαδικασία NER σε βυζαντινό κείμενο της επιλογής του φοιτητή, η οποία περιλαμβάνει εγχειρίδιο σχολιασμού, εκπαιδευμένο μοντέλο, έκθεση αξιολόγησης και δημόσια παρουσίαση

Φόρτος εργασίας — Κατανομή ECTS

Σύνολο 250 ώρες

Διαλέξεις

39

Εβδομαδιαίες ασκήσεις

91

Τελική εργασία και παρουσίαση

120

Σύνολο μαθήματος

250

Συνιστώμενη βιβλιογραφία

Προτεινόμενη βιβλιογραφία:

  • Bird, S., Klein, E. and Loper, E. (2009). Natural Language Processing with Python. O’Reilly.

  • Jurafsky, D., & Martin, J. H. (2026). Speech and Language Processing: An Introduction to Natural Language Processing, Computational Linguistics, and Speech Recognition with Language Models (3rd ed.). https://web.stanford.edu/~jurafsky/slp3/

Κύλιση στην κορυφή