Diplomarbeit, 2000
141 Seiten, Note: 1,3
1 Einleitung
1.1 Motivation
1.2 Zielsetzung
1.3 Gliederung
2 Grundlagen
2.1 Data mining, Data Warehouse
2.1.1 Regeln
2.1.1.1 Klassifikationsregeln
2.1.1.2 Charakteristische Regeln
2.1.1.3 Regressionsregeln
2.1.1.4 Assoziationsregeln
2.1.2 Cluster
2.2 Information Retrieval
2.2.1 Standardverfahren
2.2.1.1 Boolesches Retrieval
2.2.1.2 Fuzzy Retrieval
2.2.1.3 Vektorraummodell
2.2.1.4 Cluster-Retrievalverfahren
2.2.1.5 Probabilistische IR-Verfahren
2.3 Software-Agenten
2.3.1 LAW: A learning Apprentice for the WWW
2.3.2 Syskill & Webert
2.3.3 Letizia
2.3.4 WebWatcher
2.4 Selbstorganisierende Merkmalskarten
2.4.1 WEBSOM
2.5 Multidimensionale Skalierung
2.5.1 MDS nach dem Verfahren von Kruskal
2.5.2 MDS nach dem SMACOF-Verfahren
3 Eigener Ansatz
3.1 Szenario
3.2 Dokumentbearbeitung
3.2.1 Anforderungen an einen Stoppvektor
3.2.2 Anforderungen an einen Thesaurus
3.2.3 Generierung von Dokumentenvektoren
3.3 Dokumentenkartenerstellung
4 Simulation
4.1 Dokumentbearbeitung
4.1.1 Generierung eines Stoppvektors
4.1.2 Generierung eines Thesaurus
4.1.3 Generierung eines Dokumentenvektors
4.2 Dokumentenkartenerstellung
4.2.1 Definition eines Ähnlichkeitsmaßes
4.2.2 Anordnung der Dokumente nach dem CARD-Algorithmus
4.2.3 Anordnung der Dokumente mit MDS-Algorithmen
4.2.3.1 Anordnung nach dem Verfahren von Kruskal
4.2.3.2 Anordnung nach dem SMACOF-Verfahren
5 Softwarestruktur
5.1 Implementierung der Dokumentbearbeitung mit ACCESS
5.1.1 Generierung des Stoppvektors
5.1.2 Generierung eines Thesaurus
5.1.3 Erstellung des Dokumentvektors
5.2 Implementierung der Dokumentenkartenerstellung mit JAVA
5.2.1 Basismethoden
5.2.2 Der CARD-Algorithmus
5.2.3 Der MDS-Algorithmus nach Kruskal
5.2.4 Der MDS-Algorithmus nach der SMACOF-Methode
6 Diskussion und Ausblick
Das Hauptziel dieser Arbeit ist die Entwicklung und Implementierung eines adaptiven Systems zur Informationssuche im Internet, das die Dokumentenflut für Benutzer durch eine übersichtliche, grafische Visualisierung minimiert und die Identifikation semantisch ähnlicher Inhalte erleichtert.
3.2.3 Generierung von Dokumentvektoren
Bei der Generierung eines Dokumentvektors für das jeweilige HTML-Dokument sind mehrere Faktoren zu berücksichtigen. Als erstes gilt es, sich den Aufbau eines HTML-Dokumentes näher zu betrachten. Im Gegensatz zu einem "normalen" Textdokument besteht ein HTML-Dokument nicht nur aus dem geschriebenen Text, sondern enthält zusätzlich zum Text noch Metainformationen in sog. Tags, die für den Betrachter einer HTML-Seite nicht sichtbar sind. Diese Tags beinhalten, abhängig von ihrem Standort im HTML-Dokument, unterschiedliche Informationen. Im sog. Kopfbereich (Head) des HTML-Dokuments befinden sich Tags, die z.B. Angaben zum Autor (Author), Schlüsselworte (Keyword), Klassifizierungsmerkmale des Dokuments (Classification) und den Dokumenteninhalt in Kurzform beschreibende Worte (Description) enthalten. Dagegen beinhalten die Tags im sog. Rumpf zum einen Formatierungsanweisungen, wie z.B. Überschriftsformate (Titel, Überschrift 1-6), Absatzformate (Absatzmarken, Absatzeinrückung, Absatzausrichtung, Schriftgröße im Absatz) und Zeichenformate (Zeichengröße, Zeichenfarbe, Schriftstil), zum anderen beinhalten sie Links (Verweise) z.B. auf Textstellen im gleichen Dokument (Text-Anker) oder auf andere Dokumente (Verzweigung über sog. URLs). Es stellt sich somit die Frage, inwiefern diese Metainformationen bei der Erstellung des Dokumentvektors mit einbezogen werden sollten. So kann davon ausgegangen werden, daß Worte, die vom Autor als Klassifizierungsmerkmale und/oder zusätzliche Inhaltsbeschreibungen im Kopfbereich angegeben werden, gute Synonyme und zusätzliche Begriffe für im Dokumententext nicht verwandte Begriffe darstellen.
1 Einleitung: Beschreibt die Problematik der Informationsflut im Internet und die Zielsetzung der Arbeit, ein adaptives System zur Unterstützung der Informationssuche zu implementieren.
2 Grundlagen: Gibt einen Überblick über Forschungsbereiche wie Data Mining, Information Retrieval, Software-Agenten sowie Visualisierungsmethoden wie SOMs und MDS.
3 Eigener Ansatz: Definiert das Szenario der Arbeit und beschreibt das zu implementierende Modell sowie die notwendigen Schritte der Dokumentbearbeitung und Dokumentenkartenerstellung.
4 Simulation: Dokumentiert die konkrete Umsetzung des Modells und die Ergebnisse der Anwendung der Algorithmen zur Dokumentenbearbeitung und Anordnung.
5 Softwarestruktur: Erläutert die technische Implementierung der entwickelten Algorithmen unter Verwendung von Microsoft ACCESS und JAVA.
6 Diskussion und Ausblick: Bewertet die erlangten Ergebnisse der verschiedenen Algorithmen hinsichtlich ihrer Qualität und Effizienz und zeigt mögliche Weiterentwicklungen auf.
Information Retrieval, Internet, Dokumentenkarte, CARD-Algorithmus, Data Mining, Software-Agenten, selbstorganisierende Merkmalskarten, Multidimensionale Skalierung, Dokumentvektor, Thesaurus, Adaptivität, Visualisierung, HTML, Stoppvektor, Ähnlichkeitsmaß.
Die Arbeit befasst sich mit der Entwicklung eines adaptiven Systems zur Informationssuche im Internet, das große Datenmengen durch Visualisierung für den Anwender handhabbar macht.
Die Themen umfassen Data Mining, Information Retrieval, den Einsatz von lernenden Software-Agenten sowie mathematische Verfahren zur Visualisierung von Dokumentbeziehungen.
Ziel ist die Implementierung eines Modells, das HTML-Dokumente automatisch analysiert und in einer grafischen 2D-Dokumentenkarte so anordnet, dass ähnliche Inhalte nah beieinander liegen.
Es werden verschiedene Algorithmen zur Dokumentbearbeitung und zur Cluster-Visualisierung (insbesondere multidimensionale Skalierung und der eigene CARD-Ansatz) untersucht und angewendet.
Der Hauptteil gliedert sich in die theoretischen Grundlagen, die Beschreibung des eigenen Ansatzes, die Simulation und Erprobung der Algorithmen sowie deren konkrete softwaretechnische Umsetzung.
Zu den zentralen Begriffen gehören Information Retrieval, Dokumentenkarte, CARD-Algorithmus, selbstorganisierende Karten, Multidimensionale Skalierung und Adaptivität.
Durch die automatische Extraktion von Merkmalen und die Erstellung von Dokumentvektoren ermöglicht das System eine inhaltliche Einordnung der Dokumente, die dem Nutzer visuell als Karte präsentiert wird.
Im Gegensatz zu zufallsbasierten Methoden liefert der CARD-Algorithmus bei der Anordnung der Dokumente stets ein deterministisches, reproduzierbares Ergebnis.
Der GRIN Verlag hat sich seit 1998 auf die Veröffentlichung akademischer eBooks und Bücher spezialisiert. Der GRIN Verlag steht damit als erstes Unternehmen für User Generated Quality Content. Die Verlagsseiten GRIN.com, Hausarbeiten.de und Diplomarbeiten24 bieten für Hochschullehrer, Absolventen und Studenten die ideale Plattform, wissenschaftliche Texte wie Hausarbeiten, Referate, Bachelorarbeiten, Masterarbeiten, Diplomarbeiten, Dissertationen und wissenschaftliche Aufsätze einem breiten Publikum zu präsentieren.
Kostenfreie Veröffentlichung: Hausarbeit, Bachelorarbeit, Diplomarbeit, Dissertation, Masterarbeit, Interpretation oder Referat jetzt veröffentlichen!

