{"id":2189,"date":"2010-03-04T14:21:01","date_gmt":"2010-03-04T14:21:01","guid":{"rendered":"http:\/\/impactocr.wordpress.com\/?p=72"},"modified":"2010-03-04T14:21:01","modified_gmt":"2010-03-04T14:21:01","slug":"funktionsweise-und-zusammenwirken-der-technischen-werkzeuge-von-impact","status":"publish","type":"post","link":"https:\/\/digitisation.eu\/?p=2189","title":{"rendered":"Funktionsweise und Zusammenwirken der technischen Werkzeuge von\u00a0IMPACT"},"content":{"rendered":"<p>Sven Schlarb von der \u00d6sterreichischen Nationalbibliothek stellte die im Rahmen von IMPACT entwickelten technischen Werkzeuge und deren Zusammenarbeit vor.<\/p>\n<p><!--more--><\/p>\n[slideshare id=3333343&amp;doc=schlarbimpact-werkzeuge-100304062618-phpapp02]\n<p>http:\/\/www.vimeo.com\/9913776<\/p>\n<p>Der Vortrag begann mit einer \u00dcbersicht der Schwierigkeiten, vor denen einen die Digitalisierung und Texterkennung historischer Texte stellt. Durch Feuchtigkeit oder Dicke der B\u00fccher gew\u00f6lbte Buchseiten, Falten und Knicke in den Seiten, Farbflecken, unterschiedliche Druckintensit\u00e4ten, durchscheinende Buchstaben von der R\u00fcckseite, Frakturschrift, handschriftliche Anmerkungen, historische Sprachen und Schreibvarianten oder komplexes Layout stellen eine automatische Texterkennung vor gro\u00dfe Herausforderungen.<\/p>\n<p>F\u00fcr viele dieser Probleme versucht IMPACT aber, L\u00f6sungen zu entwickeln. So werden Werkzeuge entwickelt, die z.B. schwarze R\u00e4nder um ein Bild, die OCR eventuell verwirren k\u00f6nnen, erkennen und entfernen k\u00f6nnen, W\u00f6lbungen und Falten geometrisch entzerrt werden und Binarisierung verbessert werden soll.<\/p>\n<p>Durch die Entwicklung historischer Lexika in den Sprachen Deutsch, Niederl\u00e4ndisch und Englisch (sowie weiterer durch die neuen, osteurop\u00e4ischen Partner) und die Erstellung eines Verzeichnisses historischer Eigennamen soll die Worterkennung historischer Texte verbessert werden.<\/p>\n<p>Ein spannendes Werkzeug stellt auch der Functional Extension Parser (FEP) dar, welcher nicht Text erkennt, sondern Layoutstrukturen, welche im n\u00e4chsten Schritt die Texterkennung erleichtern k\u00f6nnte, wie beispielsweise eine fortschrittlichere Erkennung der Seitenzahlen und des Druckbereichs.<\/p>\n<p>Das Ziel von IMPACT ist es, eine Interoperabilit\u00e4t aller relevanten Tools zu erzielen.<\/p>\n<p>&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;<\/p>\n<p>Sven Schlarb of the Austrian National Library (ONB) gave an overview over the technicals tools developed in IMPACT, and their intended collaboration. Historical texts present a number of challenges for automated text recognition, e.g. old typefaces, out-dated words and spelling, complex layouts, speckled, curved and cracked paper, to name only a few. IMPACT tries to develop solutions for all of these problems. This includes tools to straighten out curves and cracks of pages in the digital image, and improved binarisation and special historical dictinaries to aid the OCR. Another example would be the Functional Extension Parser (FEP) that recognises layout structures to ease text recognition by detecting page numbers and similar layout elements. All IMPACT tools should be fully interoperable in the end.<\/p>\n<p><em>Mark-Oliver Fischer (BSB)<\/em><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Sven Schlarb von der \u00d6sterreichischen Nationalbibliothek stellte die im Rahmen von IMPACT entwickelten technischen Werkzeuge und deren Zusammenarbeit vor.<\/p>\n","protected":false},"author":4217,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[154],"tags":[],"class_list":["post-2189","post","type-post","status-publish","format-standard","hentry","category-discussions"],"acf":[],"_links":{"self":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/posts\/2189","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/users\/4217"}],"replies":[{"embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=2189"}],"version-history":[{"count":0,"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/posts\/2189\/revisions"}],"wp:attachment":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=2189"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=2189"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=2189"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}