{"id":2685,"date":"2010-03-04T16:13:28","date_gmt":"2010-03-04T16:13:28","guid":{"rendered":"http:\/\/impactocr.wordpress.com\/?p=83"},"modified":"2010-03-04T16:13:28","modified_gmt":"2010-03-04T16:13:28","slug":"fallstudie-i-ocr-strukturierung-entstehung-und-prasentation-von-unterschiedlichen-erschliesungsarten","status":"publish","type":"post","link":"https:\/\/digitisation.eu\/?p=2685","title":{"rendered":"Fallstudie I: OCR &#038; Strukturierung \u2013 Entstehung und Pr\u00e4sentation von unterschiedlichen\u00a0Erschlie\u00dfungsarten"},"content":{"rendered":"<p>Karl M\u00e4rker (BSB) pr\u00e4sentierte drei Beispiele unterschiedlicher Erschlie\u00dfungsarten aus Projekten der Bayerischen Staatsbibliothek, die noch vor IMPACT entstanden.<\/p>\n[slideshare id=3334901&amp;doc=mrkercasestudy1karlmaerker-100304080253-phpapp02]\n<p>http:\/\/www.vimeo.com\/9914036<\/p>\n<p>Warum \u00fcberhaupt OCR? OCR bietet nicht nur die M\u00f6glichkeit, im Text zu suchen, sondern erm\u00f6glicht auch Verweise (Links) innerhalb der Texte, erleichtert das Ausdrucken und die Lesbarkeit bei z.B. Frakturschriften und schlecht erhaltenen Vorlagen, sofern der Volltext den Nutzen zug\u00e4nglich gemacht wird. Abzuw\u00e4gen sind bei jedem Projekt selbstverst\u00e4ndlich die vorhandenen Ressourcen (Zeit, Geld, Infrastruktur) und das Ziel, welches man erreichen will.<\/p>\n<p>Die drei Beispiele repr\u00e4sentieren verschiedene Erschlie\u00dfungsarten. Als Beispiel eines seitenbezogenen Volltexts diente die &#8220;Zeitschrift f\u00fcr Bayerische Landesgeschichte&#8221;, f\u00fcr die &#8220;Sitzungsberichte des Reichstags&#8221; wurde eine Registererschlie\u00dfung mit Seitenverweisen gew\u00e4hlt, w\u00e4hrend das &#8220;Biographische Lexikon von Lipowsky&#8221; als Beispiel f\u00fcr einen inhaltlich voll erschlossenen Volltext dient.<\/p>\n<p>Die <a href=\"http:\/\/www.bayerische-landesbibliothek-online.de\/zblg\">Zeitschrift f\u00fcr Bayerische Landesgeschichte<\/a> diente als Beispiel einer sehr einfachen Erschlie\u00dfung. Es wurde mit &#8216;schmutziger&#8217;, also unkorrigierter OCR gearbeitet, zus\u00e4tzlich wurden die Artikeltitel und Katalogdaten erschlossen. Eine Suche verweist auf die Seite, der OCR-Volltext wird nicht angezeigt.<\/p>\n<p>Die <a href=\"http:\/\/www.reichstagsprotokolle.de\/index.html\">Berichte der Sitzungen des Reichstags<\/a> wurden bisher nur auf Registerebene erschlossen, eine weitere Anreicherung \u00fcber die Personennamendatei PND und eine Verkn\u00fcpfung mit den Handb\u00fcchern des Reichstags ist in Arbeit.\u00a0 Da die Sitzungsberichte von der Zeit des Norddeutschen Bundes bis ins &#8216;Dritte Reich&#8217; reichen, besteht eine gro\u00dfe Heterogenit\u00e4t der Register, teils wurde nach Sach- und Personenregister getrennt, teils sind die Register gemischt. Suchm\u00f6glichkeiten bestehen auf der Ebene von Registereintr\u00e4gen, nach Jahrg\u00e4ngen, Stichworten und PND.<\/p>\n<p>Bei den <a href=\"http:\/\/personen.digitale-sammlungen.de\/pnd\/start.html\">Biographischen Lexika von Felix Joseph Lipowsky<\/a> wurde eine halbautomatische Auszeichnung innerhalb des Textes gew\u00e4hlt, bei der Orte, Personennamen und Berufe ausgezeichnet wurden, nach denen auch gesucht werden kann. Volltext und Digitalisat sind miteinander verlinkt.<\/p>\n<p>Zum Ausblick: Ideal w\u00e4re es, OCR bei allen Digitalisaten in Antiquaschrift zu verwenden, automatisch strukturiert mit \u00dcberschriften, Seitenzahlen, etc. Je nach Projekt bietet sich eine weitere inhaltliche Erschlie\u00dfung in Handarbeit oder automatisch an. Auch eine projekt\u00fcbergreifende Erschlie\u00dfung wie bei der PND bietet gro\u00dfe Vorteile.<\/p>\n<p>&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;<\/p>\n<p>Karl M\u00e4rker of the Bavarian State Library (BSB) presented three examples of different kinds of indexing of digital ressources. For the <a href=\"http:\/\/www.bayerische-landesbibliothek-online.de\/zblg-en\">Journal for Bavarian Regional History<\/a>, &#8216;dirty&#8217; (=uncorrected) OCR was used. In addition, only the titles of articles and metadata from the catalogue were indexed. A search leads to the page, the search term is not highlighted, nor is the full text shown to the user. For the <a href=\"http:\/\/www.reichstagsprotokolle.de\/en_index.html\">Session Reports of the German Reichstag and its Precursors<\/a> only the registers were indexed until now. For additional enhancement, the reports will be linked to the Reichstag handbooks and the &#8220;Personennamendatei&#8221; PND. A problem with the register index lies in the great heterogeneity of the registers. Some are divided in subject and people indices, some not, for example. For the <a href=\"http:\/\/personen.digitale-sammlungen.de\/pnd\/start.html\">Biographical Dictionaries by Felix Joseph Lipowsky<\/a>, a semi-automatic indexing by places, person names and occupations was used, full text and digital image are linked and can be used parallel.<\/p>\n<p><em>Mark-Oliver Fischer (BSB)<\/em><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Karl M\u00e4rker (BSB) pr\u00e4sentierte drei Beispiele unterschiedlicher Erschlie\u00dfungsarten aus Projekten der Bayerischen Staatsbibliothek, die noch vor IMPACT entstanden. [slideshare id=3334901&amp;doc=mrkercasestudy1karlmaerker-100304080253-phpapp02] http:\/\/www.vimeo.com\/9914036 Warum \u00fcberhaupt OCR? OCR bietet nicht nur die M\u00f6glichkeit, im Text zu suchen, sondern erm\u00f6glicht auch Verweise (Links) innerhalb der Texte, erleichtert das Ausdrucken und die Lesbarkeit bei z.B. Frakturschriften und schlecht erhaltenen Vorlagen, &hellip; <a href=\"https:\/\/digitisation.eu\/?p=2685\" class=\"more-link\">Continue reading<span class=\"screen-reader-text\"> &#8220;Fallstudie I: OCR &#038; Strukturierung \u2013 Entstehung und Pr\u00e4sentation von unterschiedlichen\u00a0Erschlie\u00dfungsarten&#8221;<\/span><\/a><\/p>\n","protected":false},"author":4217,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[154,159],"tags":[],"class_list":["post-2685","post","type-post","status-publish","format-standard","hentry","category-discussions","category-optical-character-recognition"],"acf":[],"_links":{"self":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/posts\/2685","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/users\/4217"}],"replies":[{"embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=2685"}],"version-history":[{"count":0,"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/posts\/2685\/revisions"}],"wp:attachment":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=2685"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=2685"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=2685"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}