ScanSnapシリーズ総合スレ Part27
■ このスレッドは過去ログ倉庫に格納されています
0432名無しさん@お腹いっぱい。
2012/11/11(日) 03:53:14.88ID:OmWGlacKそのままでは読むに耐えないほどの誤読が発生するってこった。
日本語OCRの精度はどこのメーカーもはっきり出していないが、99%としても
100文字に1字の間違いになる。例えば1ページに800文字としても1ページに8個の誤読がある。
書体や印刷の状態によってはもっとうんと精度が落ちるから、毎行ごとに何個か誤読が混じる場合がある。
これを使い物になるかならないか、というのは個人差もあると思うが
普通、誤植は、まともな出版社だったら、雑誌の場合1冊につき3〜4個から多くて5〜6個どまりが
限界と言われてるし、単行本なんかではもっとずっと許容度は低い。
専門書など、内容によっては1〜2個の誤植でも正誤表の必要なレベル。
1ページに何個か誤植のあるテキストでも何とか分かればいいや、という場合もあるだろうが
毎ページに誤植があるなんてとんでもない使い物にならない、という本もある。
この話はもう何度も繰り交わされてるが、OCRは完全テキスト化を目的にすると
使い物にならない、PDFに検索かける程度ならOKというのが共通の認識になってる。
実際に自分でやってみればすぐ分かる。
■ このスレッドは過去ログ倉庫に格納されています