{"id":2687,"date":"2010-03-04T18:25:27","date_gmt":"2010-03-04T18:25:27","guid":{"rendered":"http:\/\/impactocr.wordpress.com\/?p=91"},"modified":"2010-03-04T18:25:27","modified_gmt":"2010-03-04T18:25:27","slug":"fallstudie-ii-aufbau-und-verwendung-spezieller-lexika-bei-der-digitalisierung-historischer-kollektionen-2","status":"publish","type":"post","link":"https:\/\/digitisation.eu\/?p=2687","title":{"rendered":"Fallstudie II: Aufbau und Verwendung spezieller Lexika bei der Digitalisierung historischer Kollektionen"},"content":{"rendered":"<p>Christoph Ringlstetter vom Centrum f\u00fcr Informations- und Sprachverarbeitung der Ludwig Maximilians-Universit\u00e4t berichtete \u00fcber die Erstellung historischer Lexika im Rahmen von IMPACT.<\/p>\n<p><!--more--><\/p>\n<p>Dass speziell angepasste Lexika bei der Texterkennung historischer Texte \u00e4u\u00dferst hilfreich sein k\u00f6nnen, wurde schon im bisherigen Verlauf der Veranstaltung deutlich. Doch gerade hier liegen auch die Schwierigkeiten. Mangels einheitlicher orthographischer Regeln existiert eine Vielzahl unterschiedlicher Schreibweisen f\u00fcr die selben Worte, so z.B. &#8216;Teyl&#8217;, &#8216;Theil&#8217; oder &#8216;Theyl&#8217; &#8211; statt Teil. Selbst wenn Texterkennung diese Varianten richtig erkennt, n\u00fctzt dies dem User nichts, wenn dieser nach dem orthographisch richtigen Begriff sucht. Doch immer wieder erkennt moderne OCR statt W\u00f6rtern nur sinnlose Zeichenkombinationen wie ^.uglltt (statt August) oder ist nicht in der Lage, W\u00f6rter korrekt zu segmentieren, da Wortabst\u00e4nde in historischen Texten oft nicht einheitlich sind.<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Christoph Ringlstetter vom Centrum f\u00fcr Informations- und Sprachverarbeitung der Ludwig Maximilians-Universit\u00e4t berichtete \u00fcber die Erstellung historischer Lexika im Rahmen von IMPACT.<\/p>\n","protected":false},"author":4217,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[154],"tags":[157],"class_list":["post-2687","post","type-post","status-publish","format-standard","hentry","category-discussions","tag-impact"],"acf":[],"_links":{"self":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/posts\/2687","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/users\/4217"}],"replies":[{"embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=2687"}],"version-history":[{"count":0,"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/posts\/2687\/revisions"}],"wp:attachment":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=2687"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=2687"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=2687"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}