{"id":2750,"date":"2011-10-11T15:11:58","date_gmt":"2011-10-11T15:11:58","guid":{"rendered":"http:\/\/impactocr.wordpress.com\/?p=605"},"modified":"2011-10-11T15:11:58","modified_gmt":"2011-10-11T15:11:58","slug":"analyse-und-nachkorrektur-von-ocr-ergebnissen","status":"publish","type":"post","link":"https:\/\/digitisation.eu\/?p=2750","title":{"rendered":"Analyse und Nachkorrektur von OCR-Ergebnissen"},"content":{"rendered":"<p>Ulrich Reffle, who\u00a0works at the Centre of Information and Language\u00a0Processing of the Ludwig-Maximilians-University Munich, spoke about document-centric analysis and error detection, which can enable faster and easier correction of OCRed historical texts.<\/p>\n<p><!--more--><\/p>\n<p>http:\/\/vimeo.com\/32260841<\/p>\n[slideshare id=9697032&amp;doc=07reffleanalyseundnachkorrektur-111014091950-phpapp02]\n<p>Ulrich Reffle vom Centrum f\u00fcr Informations- und Sprachverarbeitung (CIS) der Ludwig-Maximilians-Universit\u00e4t referierte \u00fcber die dokumentenbasierte Analyse und Korrektur von historischen Volltexten.<\/p>\n<p>Dabei ging er zun\u00e4chst auf die f\u00fcr alte Drucke spezifischen Probleme bei der OCR-Texterkennung ein. Anschlie\u00dfend wurde die M\u00f6glichkeiten dokumentspezifischer Sprach- und Fehlerprofile erl\u00e4utert. Historische Werke unterscheiden sich in ihren spezifischen Charakteristika (verwendete Sprachen, Schrifttypen, etc.) oft deutlich mehr als moderne Texte. Entsprechend kann Wissen dar\u00fcber zu einer deutlichen Verbesserung der Qualit\u00e4t von OCR-Ergebnissen, Nachkorrektur und Information Retrieval (Suche) f\u00fchren. Die Profile werden dabei vollautomatisch auf Basis der reinen OCR-Ausgabe erstellt.<\/p>\n<p>Ihren konkreten Einsatz pr\u00e4sentierte der Referent am interaktiven Nachkorrektursystem des CIS. Es erkennt historische Schreibvarianten und bietet eine Batchkorrektur f\u00fcr typische OCR-Fehler. Eigene Tests h\u00e4tten eine Beschleunigung um das 2,7-fache gegen\u00fcber der Korrektur Wort f\u00fcr Wort ergeben.<\/p>\n<p>Das Korrektursystem soll demn\u00e4chst als (vorerst) kostenloser Webservice bereitgestellt werden.<\/p>\n<p><em>RM (BSB); Mark-Oliver Fischer (BSB)<br \/>\n<\/em><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Ulrich Reffle, who\u00a0works at the Centre of Information and Language\u00a0Processing of the Ludwig-Maximilians-University Munich, spoke about document-centric analysis and error detection, which can enable faster and easier correction of OCRed historical texts.<\/p>\n","protected":false},"author":4217,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[153],"tags":[],"class_list":["post-2750","post","type-post","status-publish","format-standard","hentry","category-news"],"acf":[],"_links":{"self":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/posts\/2750","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/users\/4217"}],"replies":[{"embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=2750"}],"version-history":[{"count":0,"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/posts\/2750\/revisions"}],"wp:attachment":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=2750"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=2750"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=2750"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}