{"id":2688,"date":"2010-03-05T17:07:30","date_gmt":"2010-03-05T17:07:30","guid":{"rendered":"http:\/\/impactocr.wordpress.com\/?p=97"},"modified":"2010-03-05T17:07:30","modified_gmt":"2010-03-05T17:07:30","slug":"fallstudie-ii-aufbau-und-verwendung-spezieller-lexika-bei-der-digitalisierung-historischer-kollektionen","status":"publish","type":"post","link":"https:\/\/digitisation.eu\/?p=2688","title":{"rendered":"Fallstudie II: Aufbau und Verwendung spezieller Lexika bei der Digitalisierung historischer\u00a0Kollektionen"},"content":{"rendered":"<p>Christoph Ringlstetter vom Centrum f\u00fcr Informations- und Sprachverarbeitung der Ludwig Maximilians-Universit\u00e4t berichtete \u00fcber die Erstellung historischer Lexika im Rahmen von IMPACT.<\/p>\n<p><!--more--><\/p>\n[slideshare id=3335312&amp;doc=ringlstetterlmubsbworkshop2010-100304085039-phpapp01]\n<p>http:\/\/www.vimeo.com\/9914065<\/p>\n<p>F\u00fcr welche Periode nutzen spezielle Historika \u00fcberhaupt? Projekt deckt 16. bis 18. Jahrhundert ab, je weiter man zur\u00fcck geht, um so mehr unbekannte W\u00f6rter und Schreibvarianten findet man so z.B. &#8216;Teyl&#8217;, &#8216;Theil&#8217; oder &#8216;Theyl&#8217; &#8211; statt Teil. Selbst wenn Texterkennung diese Varianten richtig erkennt, n\u00fctzt dies dem User nichts, wenn dieser nur nach dem heute orthographisch richtigen Begriff sucht. Auch lateinische W\u00f6rter (in Antiqua-Schriften) in deutschen Texten in Fraktur stellen die Texterkennung vor gro\u00dfe Probleme.<\/p>\n<p>Beispiele f\u00fcr problematische Fehler: Falsch erkannte, aber sinnvolle W\u00f6rter, wie z.B. &#8216;Tischlerei&#8217; statt &#8216;Fischerei&#8217; oder sinnlose Zeichenkombinationen wie ^.uglltt (statt August). Sehr problematisch f\u00fcr den Aufbau eines Suchindexes sind auch Fehler in der Wortsegmentierung, welche in historischen Texten auf Grund uneinheitlicher Wortabst\u00e4nde h\u00e4ufig auftreten.<\/p>\n<p>Wie muss ein spezielles Lexikon aussehen? F\u00fcr Information Retrieval w\u00e4re ein Lexikon interessant, dass ein modernes Wort mit seinen historischen Varianten verbindet, rein f\u00fcr die OCR w\u00fcrde aber auch eine reine Wortliste historischer W\u00f6rter reichen. F\u00fcr IMPACT wird aber die m\u00e4chtigere Variante gew\u00e4hlt, die historische Varianten mit modernen Lemmata verbindet.<\/p>\n<p>Wo kriegt man die entsprechenden Sprachressourcen (also &#8216;richtige&#8217; historische W\u00f6rter) her? Textkorpora im Netz gibt es fast nicht, f\u00fcr das Projekt wurden daher Texte aus dem 16. Jahrhundert von Hand &#8216;gekeyt'(=abgetippt). Ein gro\u00dfes Problem bei der Lexikonerstellung im Deutschen sind \u00fcblicherweise Komposita, diese treten in Texten des 16. und 17. Jahrhunderts aber gl\u00fccklicherweise kaum auf.<\/p>\n<p>Au\u00dferdem braucht man &#8220;geduldige Menschen mit linguistischem Hintergrund&#8221;, um zu verifizieren, dass alle Varianten im W\u00f6rterbuch auch historisch korrekt und richtig mit den modernen Lemmata verkn\u00fcpft sind. Dabei wurden bisher bereits ca. 15.000 Eintr\u00e4ge verifiziert, automatisch gematcht aber un\u00fcberpr\u00fcft sind bis zu 100 Millionen Eintr\u00e4ge. Tests zeigen dabei, dass ein automatisches Matching von modernen und historischen W\u00f6rtern zwar einen Teil der Verbindungen prinzipiell nicht erkennen kann (bspw. historische Flektionsformen wie &#8216;frug&#8217; statt &#8216;fragte&#8217;), man aber dennoch im 18. und 19. Jh. &#8216;Precision and Recall&#8217;-Werte von gut um die 95 Prozent erreicht, w\u00e4hrend f\u00fcr fr\u00fchere Jahrhunderte die Qualit\u00e4t auf deutlich unter 90 Prozent einbricht.<\/p>\n<p>&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8211;<\/p>\n<p>Christoph Ringlstetter of the Centre for Information and Language Processing of the Ludwig-Maximilians-University (LMU) presented historical dictionaries developed in IMPACT. As said in earlier talks of the day, historical texts often use language and spelling that is not found in modern dictionaries, thus presenting problems to OCR software. After some examples of these problems, he discussed the features a historical dictionary should have. For OCR alone, a simple list of outdated words would be enough, but if the goal is to also help information retrieval (as is the case with IMPACT), a dictionary has to combine a modern word with its historical variants, so that when a user searches for &#8220;Teil&#8221; (fragment, part), he would also get pages with the historical variants &#8220;Theil&#8221;, &#8220;Teyl&#8221;, or &#8220;Theyl&#8221;.<\/p>\n<p>The main problem in the creation of such a dictionary was collecting the language ressources, that is correct historical words. As there are almost no readily available corpora, IMPACT had to have texts from the 16th c. rekeyed. Another problem is the connection of modern words and historical variants, where an automatic matching based on language rules can help, but will unavoidably lose some kinds of variants in the process, e.g. verbs that were once but are no longer irregular. Therefore, it&#8217;s necessary to have some &#8220;patient people with a linguistic background&#8221; to verify all the connections, especially for words from the 17th and earlier centuries.<\/p>\n<p><em>Mark-Oliver Fischer (BSB)<\/em><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Christoph Ringlstetter vom Centrum f\u00fcr Informations- und Sprachverarbeitung der Ludwig Maximilians-Universit\u00e4t berichtete \u00fcber die Erstellung historischer Lexika im Rahmen von IMPACT.<\/p>\n","protected":false},"author":4217,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[153],"tags":[],"class_list":["post-2688","post","type-post","status-publish","format-standard","hentry","category-news"],"acf":[],"_links":{"self":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/posts\/2688","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/users\/4217"}],"replies":[{"embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=2688"}],"version-history":[{"count":0,"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/posts\/2688\/revisions"}],"wp:attachment":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=2688"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=2688"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=2688"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}