Ανάπτυξη Συστήματος Επεξεργασίας & Ανάλυσης Μεγάλου Όγκου Δεδομένων: Εφαρμογή σε Πατέντες

Μικρογραφία εικόνας

Ημερομηνία

2025-08-31

Συγγραφείς

Papadopoulos, Christos

Τίτλος Εφημερίδας

Περιοδικό ISSN

Τίτλος τόμου

Εκδότης

ΔΙΠΑΕ

Παραπομπή

Παραπομπή

Άδεια Creative Commons

Εκτός εάν σημειώνεται διαφορετικά, η άδεια αυτού του αντικειμένου περιγράφεται ως Attribution-NonCommercial-NoDerivatives 4.0 International

Περίληψη

Η παρούσα διπλωματική εργασία παρουσιάζει το PatentFusion, ένα καινοτόμο σύστημα για την επεξεργασία και ανάλυση μεγάλου όγκου δεδομένων διπλωμάτων ευρεσιτεχνίας. Το κεντρικό πρόβλημα που αντιμετωπίζει, είναι ο κατακερματισμός της πληροφορίας που προκύπτει από την ύπαρξη πολλαπλών εκδόσεων του ίδιου διπλώματος (διαφορετικά kind codes), γεγονός που δημιουργεί σημαντικές προκλήσεις στην έρευνα πατεντών. Η λύση που προτείνεται είναι η δημιουργία "Εικονικών Πατεντών" (Virtual Patents), τα οποία συνδυάζουν την πλέον επικαιροποιημένη πληροφορία από όλες τις διαθέσιμες εκδόσεις ενός διπλώματος σε ένα ενοποιημένο έγγραφο. Το σύστημα διατηρεί την πλήρη ιεραρχία XML και την ιχνηλασιμότητα της προέλευσης του κάθε στοιχείου μέσω των kind-source attributes. Το PatentFusion υλοποιεί προηγμένες τεχνικές όπως πολυεπεξεργασία ροής (streaming multiprocessing) για τη διαχείριση μεγάλων datasets, συγχώνευση βάση προτεραιότητας (priority-based merging) για την επιλογή της βέλτιστης πληροφορίας από κάθε έκδοση, και ευφυή ανίχνευση διπλότυπων (intelligent duplicate detection) για την αποφυγή επαναλήψεων. Η αρχιτεκτονική του, αφού έχει δοκιμαστεί σε επεξεργασία datasets άνω των 150GB, μπορεί να ανταπεξέλθει σε απεριόριστου μεγέθους datasets με ελάχιστη χρήση μνήμης, χάρις την αρχιτεκτονική ροής που υλοποιεί. Η πειραματική αξιολόγηση στη συλλογή WPI αποδεικνύει ότι το σύστημα μειώνει τον αριθμό των αρχείων κατά 22-35% χωρίς απώλεια πληροφορίας. Το PatentFusion ενσωματώθηκε στο πλαίσιο του WPI+, συμβάλλοντας στην τυποποίηση και αναπαραγωγιμότητα των πειραμάτων στον τομέα των διπλωμάτων ευρεσιτεχνίας. Το σύστημα αντιμετωπίζει θεμελιώδεις προκλήσεις στην ανάκτηση πληροφοριών πατεντών και στην επεξεργασία φυσικής γλώσσας παρέχοντας στους ερευνητές ενοποιημένα, πλήρη έγγραφα που εξαλείφουν την πολυπλοκότητα της διαχείρισης πολλαπλών εκδόσεων πατεντών. Αυτό βελτιώνει σημαντικά την αποδοτικότητα της έρευνας διατηρώντας πλήρη ακεραιότητα και ιχνηλασιμότητα της πληροφορίας. Η εργασία αποτελεί σημαντική συνεισφορά στον τομέα της ανάλυσης πατεντών και αποδεικνύει την πρακτική της εφαρμογή σε διάφορα ερευνητικά σενάρια συμπεριλαμβανομένων της αναζήτησης prior-art, της ταξινόμησης πατεντών, και των διαγλωσσικών εργασιών ανάκτησης.
This thesis presents PatentFusion, an innovative system for processing and analyzing large volumes of patent data. The core problem addressed is information fragmentation arising from the existence of multiple versions of the same patent (different kind codes), which creates significant challenges in patent research. The proposed solution is the creation of "Virtual Patents," which combine the most up-to-date information from all available versions of a patent into a unified document. The system maintains complete XML hierarchy and traceability of each element's origin through kind-source attributes. PatentFusion implements advanced techniques including streaming multiprocessing for handling large datasets, priority-based merging for selecting optimal information from each version, and intelligent duplicate detection to avoid repetitions. Its architecture, having been tested on datasets larger than 150GB, can handle datasets of unlimited size with minimal memory usage, thanks to its streaming architecture. Experimental evaluation on the WPI collection demonstrates that the system reduces the number of files by 22-35% without information loss. PatentFusion was integrated into the WPI+ framework, contributing to standardization and reproducibility of experiments in the patent domain. The system addresses fundamental challenges in patent information retrieval and natural language processing by providing researchers with consolidated, complete documents that eliminate the complexity of managing multiple patent versions. This significantly improves research efficiency while maintaining full information integrity and traceability. The work represents a substantial contribution to the field of patent analysis and demonstrates practical applicability across various research scenarios including prior-art search, patent classification, and cross-lingual retrieval tasks.

Περίληψη

Περιγραφή

Ευφυείς Τεχνολογίες Διαδικτύου

Λέξεις-κλειδιά

πατέντες, συγχώνευση πατεντών, kind code, kind merging, patent parsing, virtual patents, εικονικές πατέντες

Παραπομπή