{"id":2748,"date":"2011-10-11T14:23:13","date_gmt":"2011-10-11T14:23:13","guid":{"rendered":"http:\/\/impactocr.wordpress.com\/?p=601"},"modified":"2011-10-11T14:23:13","modified_gmt":"2011-10-11T14:23:13","slug":"spezial-lexika-zur-erschliesung-historischer-dokumente","status":"publish","type":"post","link":"https:\/\/digitisation.eu\/?p=2748","title":{"rendered":"Spezial-Lexika zur Erschlie\u00dfung historischer Dokumente"},"content":{"rendered":"<p>Annette Gotscharek of the Centre for Information and Language \u00a0Processing of the Ludwig-Maximilians-University talked about special dictionaries and their impact on OCR. Spelling variations and no longer used words are a big problem for OCR, making a lexicon adapted to historical texts a necessity for the creation of correct full text.<\/p>\n<p><!--more--><\/p>\n<p>http:\/\/vimeo.com\/32259386<\/p>\n[slideshare id=9697024&amp;doc=05gotscharekspezial-lexika-111014091929-phpapp01]<em><\/em><\/p>\n<p>Annette Gotscharek vom Centrum f\u00fcr Informations- und Sprachverarbeitung (CIS) der Ludwig-Maximilians-Universit\u00e4t berichtete \u00fcber Spezial-Lexika und ihre Auswirkungen auf die OCR-Erkennung.<\/p>\n<p>Problematisch dabei sind unter anderem historische Schreibvarianten und Differenzen zwischen historischem und zeitgen\u00f6ssischem Wortschatz und Wortformen. Dabei ist zu unterscheiden zwischen den\u00a0 spezifischen Anforderungen eines Lexikons f\u00fcr die OCR-Erkennung und eines Lexikons f\u00fcr die Suche im Volltext.<\/p>\n<p>Anschlie\u00dfend wurden die im CIS entwickelten Korpora und Lexika pr\u00e4sentiert.<\/p>\n<p>Das Diachrone Groundtruth-Korpus, aus verschieden Prosatexten aus den Jahren\u00a01500 bis 1950 zusammengestellt, zeigte eine deutliche L\u00fccke im 16. und 17. Jahrhundert, welche in einer Kooperation mit Dokumenten aus der Bayerischen Staatsbibliothek geschlossen werden konnte. Dadurch konnten regelm\u00e4\u00dfig auftretende Ersetzungsmuster bestimmt werden, (bspw. heute &#8216;t&#8217;, historisch oft &#8216;th&#8217;; heute &#8216;ei&#8217;, historisch oft &#8216;ey&#8217;) wodurch auf Basis heutiger W\u00f6rterb\u00fccher ein Hypothetisches Lexikon erstellt wurde, das also aus modernen W\u00f6rtern automatisch m\u00f6gliche historische Varianten generieren kann. Dieses Vorgehen ist aber nicht perfekt,\u00a0 vor allem f\u00fcr die Zeit vor 1750 ist ein manuell verifiziertes Lexikon n\u00f6tig, um gute Ergebnisse zu erzielen.\u00a0 Die Arbeit daran schreitet gut voran, durch die im CIS gesammelten Erkenntnisse konnten Projektpartner historische Lexika auch f\u00fcr slowenisch und bulgarisch erstellen.<\/p>\n<p>Zum Abschluss ging Frau Gotscharek auf ein Lexikon f\u00fcr Named Entities, also Eigennamen (von Orten, Personen, Organisationen, &#8230;) ein. Diese sind einerseits f\u00fcr die OCR eine gro\u00dfe Herausforderung, andererseits f\u00fcr die Recherche oft besonders relevant.<\/p>\n<p><em>RM (BSB); Mark-Oliver Fischer (BSB)<br \/>\n<\/em><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Annette Gotscharek of the Centre for Information and Language \u00a0Processing of the Ludwig-Maximilians-University talked about special dictionaries and their impact on OCR. Spelling variations and no longer used words are a big problem for OCR, making a lexicon adapted to historical texts a necessity for the creation of correct full text.<\/p>\n","protected":false},"author":4217,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[156],"tags":[],"class_list":["post-2748","post","type-post","status-publish","format-standard","hentry","category-events"],"acf":[],"_links":{"self":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/posts\/2748","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/users\/4217"}],"replies":[{"embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=2748"}],"version-history":[{"count":0,"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/posts\/2748\/revisions"}],"wp:attachment":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=2748"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=2748"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=2748"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}