{"id":66,"date":"2010-03-04T13:25:35","date_gmt":"2010-03-04T13:25:35","guid":{"rendered":"http:\/\/impactocr.wordpress.com\/?p=66"},"modified":"2010-03-04T13:25:35","modified_gmt":"2010-03-04T13:25:35","slug":"optische-zeichen-erkennung-ocr-einfuhrung-uberblick","status":"publish","type":"post","link":"https:\/\/digitisation.eu\/?p=66","title":{"rendered":"Optische Zeichen Erkennung (OCR) \u2013 Einf\u00fchrung &#038;\u00a0\u00dcberblick"},"content":{"rendered":"<p>Michael Fuchs von Abbyy Europe bot einen \u00dcberblick \u00fcber OCR (Optical Character Recognition &#8211; Optische Zeichenerkennung), und die Arbeit von Abbyy in IMPACT.<\/p>\n<p><!--more--><\/p>\n[slideshare id=3345003&amp;doc=fuchsocr-100305102902-phpapp02]\n<p>http:\/\/vimeo.com\/9909858<\/p>\n<p>Nach einem kurzen \u00dcberblick \u00fcber die Geschichte und die Produkte von Abbyy begann Herr Fuchs mit &#8216;captchas&#8217; &#8211; kleinen Textschnipseln zur Identifikation &#8216;echter Menschen&#8217; im Internet &#8211; da sie eben nicht von OCR gelesen werden k\u00f6nnen. Eben so wie die historischen Texte, die IMPACT eben doch maschinenlesbar machen will.<\/p>\n<p>Schwierigkeiten f\u00fcr die OCR historischer Texte k\u00f6nnen dabei aus zwei &#8216;Richtungen&#8217; auftreten: Probleme durch die Vorlage (alte Schriften wie Fraktur, veraltete W\u00f6rter und Schreibweisen, handschriftliche Anmerkungen, komplexes Layout, etc.) sowie Probleme durch das digitale Bild (schlechte Binarisierung, Staub auf dem Bild, W\u00f6lbungen und Falten in den Seiten, durchscheinende Seiten, etc.)<\/p>\n<p>Wie funktioniert OCR konkret? Die Bilder m\u00fcssen nat\u00fcrlich in die Software geladen werden, diese versucht dann zuerst die Struktur des Dokumentes zu erkennen (Abs\u00e4tze, Zeilen, W\u00f6rter, &#8230;). Dann werden die einzelnen Buchstaben anhand ihrer Form und W\u00f6rter anhand eines W\u00f6rterbuchs erkannt.<\/p>\n<p>Was will IMPACT hier tun? Im Bereich Bildqualit\u00e4t wird an Verbesserungen der Bildvorbereitung gearbeitet, bspw. an verbesserter Binarisierung der Ausgangsimages. Bei der Dokumentanalyse besteht eine Hauptschwierigkeit im komplexen Layout historischer Texte, vor allem alte Zeitungen stellen eine gro\u00dfe Herausforderung dar, hier wird an Verbesserungen der Layoutanalyse gearbeitet. Im Bereich der eigentlichen Zeichen- und Worterkennung werden spezielle W\u00f6rterb\u00fccher zu historischen Sprachen und Schreibvarianten sowie Erkennungsmuster f\u00fcr historische Buchstaben entwickelt werden. Im Bereich der &#8216;Nacharbeiten&#8217; gibt es interessante \u00dcberlegungen zu kollaborativer Korrektur.<\/p>\n<p><strong>Wir bitten die schlechte Tonqualit\u00e4t der ersten Vortr\u00e4ge zu entschuldigen, wir hatten anfangs mit technischen Schwierigkeiten zu k\u00e4mpfen.<\/strong><\/p>\n<p><strong>&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8211;<\/strong><\/p>\n<p>Michael Fuchs of Abbyy Europe presented an overview of OCR (Optical Character Recognition) and Abbyy&#8217;s participation in IMPACT. After a short overview of Abbyy&#8217;s history and products he presented in detail how OCR works &#8211; and where the problems with historical texts lie. Problems arising form the text &#8211; like old typefaces, and out-dated language and spelling are amplified by problems arising from the original or digitised page &#8211; curved or cracked pages, text from opposite pages shining through, low contrast images and the like &#8211; make the correct recognition very complex.\u00a0 IMPACT tries to find solutions for all these challenges, e.g. by developing special dictionaries for historical languages and spelling variants.<\/p>\n<p><strong>Please excuse the bad sound quality of these early speeches, as we had to overcome some technical difficulties.<\/strong><\/p>\n<p><em>Mark-Oliver Fischer (BSB)<\/em><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Michael Fuchs von Abbyy Europe bot einen \u00dcberblick \u00fcber OCR (Optical Character Recognition &#8211; Optische Zeichenerkennung), und die Arbeit von Abbyy in IMPACT.<\/p>\n","protected":false},"author":4217,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[153],"tags":[],"class_list":["post-66","post","type-post","status-publish","format-standard","hentry","category-news"],"acf":[],"_links":{"self":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/posts\/66","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/users\/4217"}],"replies":[{"embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=66"}],"version-history":[{"count":0,"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/posts\/66\/revisions"}],"wp:attachment":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=66"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=66"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=66"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}