{"id":2684,"date":"2010-03-04T15:20:32","date_gmt":"2010-03-04T15:20:32","guid":{"rendered":"http:\/\/impactocr.wordpress.com\/?p=78"},"modified":"2010-03-04T15:20:32","modified_gmt":"2010-03-04T15:20:32","slug":"digitalisierung-und-ocr-erkennung-in-bibliotheken-einige-anmerkungen-aus-der-praxis","status":"publish","type":"post","link":"https:\/\/digitisation.eu\/?p=2684","title":{"rendered":"Digitalisierung und OCR-Erkennung in Bibliotheken. Einige Anmerkungen aus der\u00a0Praxis"},"content":{"rendered":"<p>G\u00fcnter M\u00fchlberger von der Universit\u00e4tsbibliothek Innsbruck\u00a0 berichtete davon, wie OCR in bibliothekarischen Digitalisierungsprojekten eingesetzt wurde und wird, sowie was gute und schlechte Digitalisierung f\u00fcr OCR ausmacht.<\/p>\n<p><!--more--><\/p>\n[slideshare id=3344349&amp;doc=mhlbergerlibrarydigitisation-100305090548-phpapp01]\n<p>http:\/\/www.vimeo.com\/9938851<\/p>\n<p>Er konstatierte, dass OCR in Bibliotheken bisher eher stiefm\u00fctterlich behandelt wird, da man die zus\u00e4tzlichen Kosten scheut und die Probleme f\u00fcr zu gro\u00df h\u00e4lt. F\u00fcr Googles Digitalisierungsprojekt scheint dagegen zu gelten &#8216;Jedes erkannte Wort ist besser als kein erkanntes Wort&#8217;. Tats\u00e4chlich bedeutet OCR anf\u00e4nglich einen deutlichen Zusatzaufwand, man muss sie bei allen Schritten eines Projekts bedenken und evtl. \u00c4nderungen vornehmen.<\/p>\n<p>Am Anfang steht dabei die Frage, was man scannen m\u00f6chte &#8211; gebundene Vorlagen, lose Bl\u00e4tter, Mikrofilme -, mit welcher Technik man arbeitet &#8211; Buchscanner in Handauflage oder Scanroboter &#8211; und schlie\u00dflich, ob man \u00fcberhaupt selber scannen oder das Projekt einem Dienstleister im In- oder Ausland \u00fcbergeben will.<\/p>\n<p>Bei jeder Technik das entscheidendste bleibt die Sorgfalt des Scan-Operateurs. Ein gutes Bild ist scharf, richtig ausgeleuchtet (heller Hintergrund, deutlich erkennbare Buchstaben), kein Durchscheinen von der R\u00fcckseite, etc.<\/p>\n<p>Nach der Vorstellung diverser Beispiel guter wie schlechter Vorlagen widmete Herr M\u00fchlberger sich der Frage, welches die ideale Aufl\u00f6sung und Farbtiefe f\u00fcr OCR sei. Auch wenn es hier verschiedene Sichtweisen gibt, zeige die eigene Erfahrung, dass im Zweifelsfall die h\u00f6here Variante (400 statt 300 dpi, 24 bit Farbe statt 1 bit bitonal) immer vorzuziehen sei.<\/p>\n<p>Auch bei der Frage, welche Erkennungsrate man anstrebe, herrsche keine Einigkeit. Einerseits gilt eine Genauigkeit von unter 90% sicher richtig erkannten W\u00f6rtern als schlecht, andererseits muss digitalisierenden Institutionen wie Nutzern klar sein, dass Texterkennung immer Fehler produzieren wird. Fehler m\u00fcssen also nicht peinlich sein.<\/p>\n<p>Nach einigen konkreten Beispielen aus der Praxis von gut und weniger gut erkannten Vorlagen wurde die Frage der Korrektur von OCR-Ergebnissen behandelt. Hier gibt es positive Beispiele wie ein &#8216;crowd-sourcing&#8217;-Projekt in Australien, wo Nutzer ehrenamtlich jeden Monat 400 bis 1000 Seiten historischer Zeitungen korrigieren. Im Rahmen von IMPACT werden von IBM und von der Ludwig-Maximilians-Universit\u00e4t Werkzeuge zur professionellen Korrektur auf kollaborativer Basis entwickelt.<\/p>\n<p>Wie kann man die Ergebnisse einer OCR weiterverwenden? Hier entwickelt IMPACT beispielsweise den Functional Extension Parser, der OCR-Ergebnisse um Strukturinformationen anreichert. Dies erh\u00f6ht aber auch den Aufwand jeder Archivierung der Ergebnisse, hier gibt es mehrere konkurrierende Formate wie ALTO, Abbyy XML, etc.<\/p>\n<p>Zusammenfassend lasse sich sagen, dass OCR inzwischen Pflicht sei. Ergebnisse f\u00fcr das 19. und 20. Jahrhundert seien schon sehr gut, f\u00fcr die Zeiten davor lassen sich deutliche Fortschritte durch IMPACT erwarten.<\/p>\n<p>&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;<\/p>\n<p>G\u00fcnter M\u00fchlberger of the University Library Innsbruck (UIBK) talked about how OCR is used in libraries&#8217; digitisation project and how (not) to digitise for OCR.\u00a0 For most libraries, OCR is just something costly and complex, so it&#8217;s not done at all. If you want to &#8216;do&#8217; OCR, you have to rethink and adjust all parts of you project. When planning a digitisation project(with or without OCR), the first questions usually are what to digitise (bound books, loose pages, microfilm, &#8230;?), how to digitise (book scanner, scan robot, &#8230;?), and if to digitise for yourself at all, or assign a service provider. But in all cases, accuracy and care of the one operating the scanner have more influence than technology on the quality of the results.<\/p>\n<p>Regarding the question for the &#8216;ideal&#8217; resolution and colour depth of images for OCR, there are competing points of view, but UIBK&#8217;s own experience shows that in critical cases, more is better (400 instead of 300 dpi, 24 bit colour instead of 1 bit bitonal or 8 bit greyscale).\u00a0 The talk also touched on the question of what is a &#8216;good&#8217; recognition rate, on ideas for collaborative correction of OCR results and the challenges of archiving text recognition output. In conclusion: OCR is an obligation, results for 19th and 20th c. are already good, for the centuries before that IMPACT will provide noticeable improvements.<\/p>\n<p><em>Mark-Oliver Fischer (BSB)<\/em><\/p>\n","protected":false},"excerpt":{"rendered":"<p>G\u00fcnter M\u00fchlberger von der Universit\u00e4tsbibliothek Innsbruck\u00a0 berichtete davon, wie OCR in bibliothekarischen Digitalisierungsprojekten eingesetzt wurde und wird, sowie was gute und schlechte Digitalisierung f\u00fcr OCR ausmacht.<\/p>\n","protected":false},"author":4217,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[154,159],"tags":[],"class_list":["post-2684","post","type-post","status-publish","format-standard","hentry","category-discussions","category-optical-character-recognition"],"acf":[],"_links":{"self":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/posts\/2684","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/users\/4217"}],"replies":[{"embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=2684"}],"version-history":[{"count":0,"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/posts\/2684\/revisions"}],"wp:attachment":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=2684"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=2684"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=2684"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}