Επεξεργασία φυσικής γλώσσας για το Βυζαντινό Σώμα Κειμένων
Μεταπτυχιακό Πρόγραμμα — Επίπεδο 7
ΜΑΘΗΣΙΑΚΑ ΑΠΟΤΕΛΕΣΜΑΤΑ
Μετά την ολοκλήρωση του μαθήματος, οι φοιτητές θα είναι σε θέση να:
1)
Εξηγήσουν τις βασικές έννοιες της NLP (τοκενοποίηση, λεμματοποίηση, αναγνώριση ονοματικών οντοτήτων, ταξινόμηση κειμένων, μοντελοποίηση θεμάτων) και τη σημασία τους για τη βυζαντινή φιλολογία και την ιστορική έρευνα
2)
Χρησιμοποιούν τη γλώσσα Python και τις τυπικές βιβλιοθήκες επεξεργασίας φυσικής γλώσσας (CLTK, spaCy, NLTK, pandas) για τη φόρτωση, την προεπεξεργασία και την ανάλυση βυζαντινών ελληνικών κειμένων από τα κυριότερα ψηφιακά αποθετήρια
3)
Σχεδιάζουν και να εφαρμόζουν κατευθυντήριες γραμμές επισημάνσεων για βυζαντινές ονοματικές οντότητες (πρόσωπα, αξιώματα, τοπωνύμια, δυναστείες, ημερομηνίες) και να δημιουργούν επισημασμένα σύνολα δεδομένων χρησιμοποιώντας τα εργαλεία Prodigy ή Label Studio
4)
Να εκπαιδεύουν, να αξιολογούν και να ερμηνεύουν κριτικά ένα μοντέλο NER ειδικού τομέα χρησιμοποιώντας τους δείκτες ακρίβειας, ανάκλησης και F1
5)
Να εφαρμόζουν μεθόδους στιλομετρικής ανάλυσης και μοντελοποίησης θεμάτων σε βυζαντινά σώματα κειμένων και να ερμηνεύουν τα αποτελέσματα στο ιστορικό και φιλολογικό τους πλαίσιο
6)
Αξιολογούν κριτικά τις δυνατότητες και τους περιορισμούς των μεγάλων γλωσσικών μοντέλων και των εργαλείων τεχνητής νοημοσύνης, όταν εφαρμόζονται σε μεσαιωνικά ελληνικά κείμενα
7)
Σχεδιάσουν και να υλοποιήσουν ένα ολοκληρωμένο έργο επεξεργασίας φυσικής γλώσσας (NLP) με βάση ένα βυζαντινό κείμενο, συνδυάζοντας τη φιλολογική εμπειρογνωμοσύνη με υπολογιστικές μεθόδους
ΠΡΟΓΡΑΜΜΑ ΜΑΘΗΜΑΤΟΣ
13 Ενότητες
Εβδομάδα 01 | Επεξεργασία Κειμένου στη Python
Ψηφιακοί πόροι για βυζαντινά κείμενα.
Εβδομάδα 02 | Prompt Literacy για τις Ανθρωπιστικές Επιστήμες
Φόρτωση βυζαντινών κειμένων, βασικές λειτουργίες με συμβολοσειρές.
Εβδομάδα 03 | Προεπεξεργασία της Μεσαιωνικής Ελληνικής Γλώσσας
Τοκενοποίηση, κανονικοποίηση, πολυτονικό Unicode, γραφικές συντομογραφίες. Εργαλεία: NLTK, spaCy, CLTK.
Εβδομάδα 04 | Μορφολογική Ανάλυση και Λεμματοποίηση
Οι προκλήσεις της ελληνικής κλίσης· αξιολόγηση του CLTK σε βυζαντινά κείμενα.
Εβδομάδα 05 | Στατιστικά στοιχεία Σώματος Κειμένων και Στιλομετρία
Συχνότητα λέξεων, νόμος του Zipf, ανάλυση συγγραφικής ταυτότητας εφαρμοσμένη σε βυζαντινά κείμενα.
Εβδομάδα 06 | Αναγνώριση Ονοματικών Οντοτήτων — Έννοιες
Τύποι οντοτήτων στα βυζαντινά κείμενα· γιατί αποτυγχάνει η έτοιμη λύση NER· σύστημα επισήμανσης IOB.
Εβδομάδα 07 | Άσκηση Σχολιασμού
Σχεδιασμός κατευθυντήριων γραμμών για την επισημείωση βυζαντινών οντοτήτων.
Εβδομάδα 08 | Εκπαίδευση και Αξιολόγηση ενός Μοντέλου NER με το spaCy
Δείκτες αξιολόγησης: ακρίβεια, ανάκληση, F1. Ανάλυση σφαλμάτων.
Εβδομάδα 09 | Ταξινόμηση Κειμένων και Μοντελοποίηση Θεμάτων
Ταξινόμηση ανά είδος. Κριτική ερμηνεία.
Εβδομάδα 10 | Γραφήματα Γνώσης και Συνδεδεμένα Δεδομένα
Σύνδεση οντοτήτων με τα PBW, Pleiades, Wikidata· εισαγωγή στα τρίπλετα RDF.
Εβδομάδα 11 | Μεγάλα Γλωσσικά Μοντέλα και Βυζαντινά Κείμενα
Στρατηγικές υποβολής ερωτήσεων· κριτική αξιολόγηση της απόδοσης των μοντέλων μεγάλης γλώσσας (LLM) στα μεσαιωνικά ελληνικά· παραπληροφόρηση σε ιστορικά πλαίσια.
Εβδομάδα 12 | Εργαστήριο Πρότζεκτ
Παρουσιάσεις των φοιτητών σχετικά με την πρόοδο της διαδικασίας NER· ανατροφοδότηση από τους συμφοιτητές· επίλυση προβλημάτων.
Εβδομάδα 13 | Τελικές Παρουσιάσεις
Τελική συζήτηση: υπολογιστική ανάλυση κειμένων στη βυζαντινή επιστήμη.
ΑΞΙΟΛΟΓΗΣΗ
Αξιολόγηση φοιτητών
40%
Εβδομαδιαίες ασκήσεις
διαμορφωτική αξιολόγηση· υποβάλλεται μέσω της πλατφόρμας του μαθήματος· βαθμολογείται με βάση την ορθότητα, την ποιότητα του κώδικα και την κριτική ανάλυση
60%
Τελική Εργασία
συνολική αξιολόγηση· διαδικασία NER σε βυζαντινό κείμενο της επιλογής του φοιτητή, η οποία περιλαμβάνει εγχειρίδιο σχολιασμού, εκπαιδευμένο μοντέλο, έκθεση αξιολόγησης και δημόσια παρουσίαση
Φόρτος εργασίας — Κατανομή ECTS
Σύνολο 250 ώρες
Διαλέξεις
39
Εβδομαδιαίες ασκήσεις
91
Τελική εργασία και παρουσίαση
120
Σύνολο μαθήματος
250
Συνιστώμενη βιβλιογραφία
Προτεινόμενη βιβλιογραφία:
Bird, S., Klein, E. and Loper, E. (2009). Natural Language Processing with Python. O’Reilly.
Jurafsky, D., & Martin, J. H. (2026). Speech and Language Processing: An Introduction to Natural Language Processing, Computational Linguistics, and Speech Recognition with Language Models (3rd ed.). https://web.stanford.edu/~jurafsky/slp3/

