{"id":2689,"date":"2010-03-05T18:19:56","date_gmt":"2010-03-05T18:19:56","guid":{"rendered":"http:\/\/impactocr.wordpress.com\/?p=99"},"modified":"2010-03-05T18:19:56","modified_gmt":"2010-03-05T18:19:56","slug":"fallstudie-iii-sicht-der-endnutzer-was-tun-mit-den-ergebnissen-der-ocr","status":"publish","type":"post","link":"https:\/\/digitisation.eu\/?p=2689","title":{"rendered":"Fallstudie III: Sicht der Endnutzer: Was tun mit den Ergebnissen der\u00a0OCR?"},"content":{"rendered":"<p>Ralf\u00a0 Stockmann von der Staats- und Universit\u00e4tsbibliothek G\u00f6ttingen ging nach einer kurzen Vorstellung des G\u00f6ttinger Digitalisierungszentrums von der &#8220;perfekten Welt&#8221; aus, in der es keine Probleme mit OCR gibt, sondern nur die Frage zu beantworten ist, wie und wozu man ihre Ergebnisse am Besten nutzt.<\/p>\n<p><!--more--><\/p>\n[slideshare id=3344329&amp;doc=stockmanncasestudy3-100305090521-phpapp02]\n<p>http:\/\/www.vimeo.com\/9914090<\/p>\n<p>Wer sind eigentlich die Endnutzer von digitalen Angeboten mit OCR? Nat\u00fcrlich geh\u00f6ren dazu Wissenschaftler, Studierende und interessierte Laien. Aber auch Bibliothekare k\u00f6nnen davon profitieren, wenn man OCR als Hilfsmittel bei der Erschlie\u00dfung einsetzt. Und: Google und andere Suchmaschinen k\u00f6nnen Volltexte indizieren und so neue Nutzer f\u00fcr die digitalen Angebote der Bibliotheken gewinnen.<\/p>\n<p>Dies h\u00e4ngt aber auch davon ab, wie die Volltexte pr\u00e4sentiert werden. Werden sie \u00fcberhaupt nicht gezeigt und dienen nur der Erstellung eines Suchindexes, oder sind sie f\u00fcr den Nutzer voll verf\u00fcgbar, parallel zu den Digitalen Bildern &#8211; oder sogar stattdessen. Damit zusammen h\u00e4ngt auch die Frage, in welchen Formaten die Volltexte vorliegen. Werden nur die einzelnen W\u00f6rter im Suchindex aufgehoben, ohne irgendwelchen textlichen Zusammenhang, werden Wortkoordinaten gespeichert, oder der Text im Zusammenhang einer ganzen Seite, sogar des\u00a0 ganzen Dokumentes? Dabei gilt, Informationen, die man dem Nutzer nicht bietet, kann dieser auch nicht wieder herstellen.<\/p>\n<p>Vier Gruppen der Nutzung von Texterkennung: <strong>&#8216;klassische&#8217; Suche<\/strong>; <strong>Hilfsmittel bei der Generierung von Metadaten<\/strong>; <strong>text\u00fcbergreifende semantische Analysen<\/strong>; konkrete Textarbeit in <strong>&#8220;virtuelle Forschungsumgebungen&#8221;<\/strong>. Die erste Gruppe wurde im Laufe des Tages haupts\u00e4chlich besprochen, daher sollen nun Beispiele f\u00fcr die anderen drei folgen. <strong>OCR bei der Metadatengenerierun<\/strong>g: Beispielsweise lassen sich Volltexte nutzen, um die Erschlie\u00dfung von Artikeln in Zeitschriftenb\u00e4nden deutlich beschleunigen, da Titel etc. nicht mehr abgetippt, sondern aus Volltexten \u00fcbernommen werden k\u00f6nnen. So konnte f\u00fcr ein G\u00f6ttinger Zeitschriftenprojekt die Erfassungszeit pro Band um ca. 30 Prozent verk\u00fcrzt werden. <strong>Semantische Analyse<\/strong>: Durch die Auszeichnung von Personen, Themen und Themenzusammenh\u00e4ngen lassen sich text\u00fcbergreifende Beziehungen herstellen. M\u00f6glicherweise lie\u00dfe sich so eine Erschlie\u00dfungsqualit\u00e4t erreichen, die mit der manuellen Strukturdatengenerierung mithalten kann, endg\u00fcltige Ergebnisse dazu liegen aber noch nicht vor. Semantische Analysen lassen sich aber auch visualisieren, beispielsweise wird im Rahmen von Europeana an einer zeitlichen wie r\u00e4umlichen Visualisierung von Informationen. Im Beispiel wurden Publikationen von und \u00fcber Goethe und Schiller in Europa visualisiert (siehe Pr\u00e4sentation). <strong>&#8220;Virtuelle Forschungsumgebungen&#8221;<\/strong>: Hier k\u00f6nnen Volltexte als Grundlage von bspw. modernen kollaborativen Editionsprojekten dienen.<\/p>\n<p>Zusammenfassend lasse sich sagen, dass die beste Texterkennung nichts nutzt, wenn die Endnutzer nicht von den Ergebnissen profitieren. Dabei ist gar nicht vorhersehbar, welche sinnvollen Einsatzm\u00f6glichkeiten sich im Laufe der Zeit entwickeln werden, am wichtigsten ist daher eine m\u00f6glichst breite Bereitstellung der Volltexte in m\u00f6glichst vielen Formaten \/ mit m\u00f6glichst vielen Schnittstellen.<\/p>\n<p>&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;&#8212;<\/p>\n<p>Ralf Stockmann of the Goettingen State and University Library talked about a &#8220;perfect world&#8221; free from problems regarding OCR, where the only question is how best to use its outcomes. This is of course related to the question: who uses digital collections with OCR? Besides researchers, students and interested laypersons, there are the less obvious user groups of librarians, if OCR is used to help cataloguing, and search engines like Google who can bring new users to the libraries, if the digitised full text is part of their index. However, this depends upon how the full text is presented, are they totally hidden and only used to feed a search in the digital collections, are they presented in full and parallel to (or instead of) the digitised images, or something in between?<\/p>\n<p>Regarding the earlier question on how best to use OCR outcome,\u00a0 there are four general groups of usage: the <strong>&#8220;standard&#8221; search<\/strong> in a book or collection is the most obvious and most widely used group.\u00a0 A less widespread, but very interesting case is using <strong>OCR to help create metadata<\/strong> for e.g. library catalaguing. Using OCR instead of keying the titles of articles from a journal helped reduce cataloguing time by 30%, at one digital journals project in Goettingen.\u00a0 Another example for innovative uses of OCR was <strong>semantical analysis<\/strong>, that is the generation of inter-textual relations (names, places, topics, &#8230;) via OCR. The fourth case presented were <strong>&#8220;virtual research environments&#8221;<\/strong>, where full texts could be helpful for collaborative edition projects.<\/p>\n<p>The bottom line was that it&#8217;s impossible to know what innovative use cases will be developed in the future, so most important for digitising institutions should be to present full texts with as few restrictions as possible, to not hinder innovation.<\/p>\n<p><em>Mark-Oliver Fischer (BSB)<\/em><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Ralf\u00a0 Stockmann von der Staats- und Universit\u00e4tsbibliothek G\u00f6ttingen ging nach einer kurzen Vorstellung des G\u00f6ttinger Digitalisierungszentrums von der &#8220;perfekten Welt&#8221; aus, in der es keine Probleme mit OCR gibt, sondern nur die Frage zu beantworten ist, wie und wozu man ihre Ergebnisse am Besten nutzt.<\/p>\n","protected":false},"author":4217,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[154],"tags":[],"class_list":["post-2689","post","type-post","status-publish","format-standard","hentry","category-discussions"],"acf":[],"_links":{"self":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/posts\/2689","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/users\/4217"}],"replies":[{"embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=2689"}],"version-history":[{"count":0,"href":"https:\/\/digitisation.eu\/index.php?rest_route=\/wp\/v2\/posts\/2689\/revisions"}],"wp:attachment":[{"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=2689"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=2689"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/digitisation.eu\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=2689"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}