Μετασχηματιστές όρασης για αναγνώριση πλαστών βίντεο

Φόρτωση...
Μικρογραφία εικόνας

Ημερομηνία

2025

Συγγραφείς

Αλταντζή, Ελένη

Τίτλος Εφημερίδας

Περιοδικό ISSN

Τίτλος τόμου

Εκδότης

ΔΙΠΑΕ

Παραπομπή

Παραπομπή

Άδεια Creative Commons

Εκτός εάν σημειώνεται διαφορετικά, η άδεια αυτού του αντικειμένου περιγράφεται ως Attribution-NonCommercial-NoDerivatives 4.0 International

Περίληψη

Η παρούσα διπλωματική εργασία εξετάζει τη χρήση μετασχηματιστών όρασης (Vision Transformers - ViTs) για την αναγνώριση πλαστών βίντεο, με έμφαση στα deepfake βίντεο. Τα deepfakes, τα οποία δημιουργούνται μέσω τεχνολογιών τεχνητής νοημοσύνης, συνιστούν σημαντική απειλή για την αξιοπιστία της ψηφιακής πληροφορίας. Στόχος της έρευνας είναι η ανάπτυξη και αξιολόγηση ενός μοντέλου μετασχηματιστή βίντεο, ικανού να διακρίνει πλαστά από τα αυθεντικά βίντεο, αξιοποιώντας σύγχρονες τεχνικές μηχανικής και βαθιάς μάθησης. Στο Πρώτο Κεφάλαιο γίνεται μια γενική εισαγωγή στο πρόβλημα της αναγνώρισης πλαστών βίντεο και παρουσιάζονται τα εργαλεία που χρησιμοποιούνται στην παρούσα έρευνα. Στο Δεύτερο Κεφάλαιο αναλύονται οι υπάρχουσες μέθοδοι ανίχνευσης deepfake, καθώς και τα χαρακτηριστικά των δεδομένων που χρησιμοποιούνται. Το Τρίτο Κεφάλαιο επικεντρώνεται στους μετασχηματιστές όρασης, περιγράφοντας τη δομή, τη λειτουργία και την εφαρμογή τους στην ανάλυση εικόνας και βίντεο. Στο Τέταρτο Κεφάλαιο παρουσιάζεται η υλοποίηση των προτεινόμενων μοντέλων, τα δεδομένα που χρησιμοποιούνται και η διαδικασία εκπαίδευσης. Στο Πέμπτο Κεφάλαιο αξιολογούνται τα μοντέλα που αναπτύχθηκαν, συνοψίζονται τα συμπεράσματα της έρευνας και προτείνονται μελλοντικές κατευθύνσεις για βελτίωση της ανίχνευσης deepfake, τόσο μέσω μετασχηματιστών όρασης αλλά και εναλλακτικές προσεγγίσεις.
This thesis explores the use of Vision Transformers (ViTs) for the detection of fake videos, with a primary focus on deepfake content. Deepfakes, generated through artificial intelligence technologies, pose a significant threat to the reliability of digital information. The objective of this research is to develop and evaluate a video transformer model capable of distinguishing fake videos from authentic ones by leveraging modern machine learning and deep learning techniques. Chapter One provides a general introduction to the problem of fake video detection, along with an overview of the tools employed in this research. Chapter Two analyzes existing deepfake detection methods as well as the characteristics of the datasets used. Chapter Three focuses on Vision Transformers, detailing their architecture, functionality, and applications in image and video analysis. Chapter Four presents the implementation of the proposed models, the datasets utilized, and the training process. Finally, Chapter Five evaluates the developed models, summarizes the research findings, and proposes future directions for enhancing deepfake detection — both with and without the use of Vision Transformers.

Περίληψη

Περιγραφή

Λέξεις-κλειδιά

Μετασχηματιστές όρασης (Vision Transformers - ViTs), Deepfake βίντεο, Πλαστά βίντεο, Μηχανική μάθηση, Βαθιά μάθηση

Παραπομπή