トップページ⇒printer
1001コメント418KB

【ADF】スキャナで連続取り込み009.jpg【OCR】

レス数が900を超えています。1000を超えると表示できなくなるよ。
0001名無しさん@お腹いっぱい。2006/04/13(木) 20:36:01ID:6iEPiQr0
数十枚、数百枚、数千枚単位の紙・書類・本などを一気に取り込む、
ドキュメントスキャナに関するスレ

漫画や書籍の取り込み方法、裁断方法、ADF、OCRに関する話題もアリ

関連情報はまとめページ参照


前スレ
【ADF】スキャナで連続取り込み008.jpg【OCR】
http://pc8.2ch.net/test/read.cgi/printer/1134740588/

「スキャナで連続取り込み」まとめページ
http://adf.dkiroku.com/
0809名無しさん@お腹いっぱい。2006/09/25(月) 18:57:44ID:Pz7fHgc+
>>808
なるほど。その場合って背表紙側をわずかな幅切断するんですよね?
わずかな幅でも問題なく裁断可能なのでしょうか?
評判のいいPK-513を考えております。
0810名無しさん@お腹いっぱい。2006/09/25(月) 20:17:35ID:sjOsKsnZ
>>809
カンナで削るのががいいらしいよ
0811名無しさん@お腹いっぱい。2006/09/25(月) 20:59:46ID:vBlaQSjn
>>809
僅かなと言っても、あんまギリギリだとノリが残ってスキャンしづらい。
俺は3〜4mmくらいで背表紙は切り落としているな。
これくらい切り落とすと、コミックスの見開き結合はキツイが、
単ページとしてみる分にはそれほど気にならない。
ちなみにPK-513の話ね。
どこでも勧められてるだけあって、良くできてる裁断機だよ。
0812名無しさん@お腹いっぱい。2006/09/25(月) 22:13:20ID:xtXJDNga
糊が残ってるとステージにこすって染みのようなスポットが
以後のスキャン画像に入ってしまうことがあるんだけど、これ
どうやってきれいにしてます?

拭いても駄目で、今は消しゴムでやってるんですが、なにか
いい方法がないかな・・・(メラミンフォームとか一瞬発狂したが、
それはさすがにやめた)。
0813名無しさん@お腹いっぱい。2006/09/25(月) 23:44:10ID:sjOsKsnZ
>>812
メーカーマニュアルにあるとおりイソプロピルアルコールを布につけて拭いてみては?
0814名無しさん@お腹いっぱい。2006/09/26(火) 06:11:27ID:yKTrGLBI
>>812
俺は液晶用のウェットティッシュ使ってるな。
ちょっと湿り気がある物で拭かないと取れないし。
08156482006/09/26(火) 12:04:41ID:2d+OH8X8
とある事情でメインマシンのHDDをMaxtorの7Y250M0(250GB、Serial ATA)から
Raptor(WD1500ADFD)2台のRAID 0に変更したので、>>661の時よりどのくらい
フルカラーが速くなるかと思ってテストしてみました。結果(取り込み条件はHDD
以外は>>658に同じ)

DocuWorks
600dpi画質劣化なし:4分00秒→3分47秒
300dpi画質劣化なし:1分02秒→1分02秒

EPSON Scan(BMP)
600dpi:2分51秒→2分14秒
300dpi:53秒→41秒

EPSON Scanではかなりの効果が出ましたが、DocuWorksはかなり微妙な結果になってます。
DocuWorksはどうも単純なHDDの転送だけでは済まない何かがあるっぽい・・・orz
0816名無しさん@お腹いっぱい。2006/09/26(火) 19:25:08ID:tgY9zaGp
>>814
オレは液晶用ですらない百均のウェットティッシュでこすり取ってる。
読み取り部分って単なる透明プラ板だから何で拭いても一緒っしょ
0817名無しさん@お腹いっぱい。2006/09/26(火) 20:09:23ID:f/iw8Zpd
Σブックの後継らしきものが発表されたそうな
ttp://ascii24.com/news/i/hard/article/2006/09/26/664806-000.html

今の書籍管理がZIPなので解凍せずに見れたら嬉しいけどねぇ

0818名無しさん@お腹いっぱい。2006/09/27(水) 08:23:35ID:rby33VR1
>>864
俺は液晶用のウェットティッシュ使ってる、って言いたいんだから
言わしといてやれよ。
0819名無しさん@お腹いっぱい。2006/09/27(水) 08:34:53ID:bMxMztSA
>>864に期待
0820名無しさん@お腹いっぱい。2006/09/27(水) 08:51:49ID:zRnbo0rg
>>817
そもそも、JPGやPDFを表示できるか疑問。
0821名無しさん@お腹いっぱい。2006/09/27(水) 18:38:37ID:AEXS0c6S
http://bcnranking.jp/flash/09-00001667.html
0822名無しさん@お腹いっぱい。2006/09/27(水) 19:51:14ID:bMxMztSA
>>820
メニューに写真、とあるからjpgくらいは表示できる様にするんじゃないかね。
zipで固めたもの、までは微妙だけど。LIBRIeも最近音沙汰無いしなぁ...

>>821
ttp://bcnranking.jp/pickup/08-00010284.html
貼るならこっちだべ。
0823名無しさん@お腹いっぱい。2006/09/27(水) 23:20:05ID:zRnbo0rg
はっきり言って、jpgが表示できれば、神機だね。
MP3プレーヤー見たい売れて、
電子書籍の本格的普及に繋がるかも。
あとは値段だな。
0824名無しさん@お腹いっぱい。2006/09/27(水) 23:36:33ID:QZbchS3b
値段は4万くらいらしい。
jpgをコンバート無しに見れたらかなり買うかも。
0825名無しさん@お腹いっぱい。2006/09/28(木) 01:24:10ID:pVjGaDHN
APIを公開して、pdf,jpg,gif,txt などを
表示できるフリーソフトが出るようにしてくれ
0826名無しさん@お腹いっぱい。2006/09/28(木) 09:25:54ID:xUjQltlh
このsonyのやつはどう?
カラーじゃないのがなんだが4階調グレーでいいならかなりいいと思うのだが。
http://www.learningcenter.sony.us/assets/itpd/reader/index.html
0827名無しさん@お腹いっぱい。2006/09/29(金) 02:56:06ID:zTSDjaNa
>>826
ttp://japanese.engadget.com/2006/01/06/sony-readr/
LIBRIeの海外版だね。国内未発売だけどPDFも読めるみたい。
国内版は、自炊ツールが出てる分手持ちの資料を取り込むには便利かと。

来週のCEATECに向けて隠し玉みたいのが出てこないもんかね。
カラー電気泳動使ったLIBRIeとか...フルカラーはまだまだかなぁ
0828名無しさん@お腹いっぱい。2006/09/30(土) 11:46:03ID:jKxDf3Vq
>>789
http://scansnap.fujitsu.com/jp/feature/soft-1.html
これの初期設定フォルダを変更とかするとできないかな。
このためだけにScanSnap本体を追加購入するのも何だとは思うけど。

しかし、ScanSnap OrganizerのOCR認識率は、Acrobat7.0の標準OCR処理よりも
精度が高い気がする。
0829名無しさん@お腹いっぱい。2006/10/01(日) 20:50:02ID:6pRhraRJ
キャノンのA3対応のドキュメントスキャナDR-5010Cについてですが、
雑誌や教科書等のカラー写真はどのくらい奇麗に取り込めるでしょうか?
1万円台のフラットベッドスキャナよりも劣りますでしょうか?
実際に使用されている方おりましたら、感想をお聞かせください。
よろしくお願いします。
0830名無しさん@お腹いっぱい。2006/10/01(日) 20:55:55ID:R9vB+MbP
参照用として困らない程度にはきれいに読み取れる
方式が違うので写真作品みたいにとっときたならフラベ
0831名無しさん@お腹いっぱい。2006/10/02(月) 01:20:54ID:fQWsA1fV
>>830
なるほど、ありがとうございます。やはりフラットベッドにはかなわないんですね。
紙送りの機能についてはいかがでしょうか?
雑誌を裁断して、取り込んでも問題なく紙は送られますでしょうか?
0832名無しさん@お腹いっぱい。2006/10/02(月) 07:16:23ID:SxgLd1K0
PFUよりCANONの方がダブルフィードは少ないらしい

それと、紙や札を数えるときの要領で、コンマ1ミリ位ずつずらしてセットすると
2枚3枚を同時に吸い込む回数は激減するよ
0833名無しさん@お腹いっぱい。2006/10/02(月) 11:31:27ID:aPF6SVHI
>>831
かなわないとかそういう意味じゃないよ
0834名無しさん@お腹いっぱい。2006/10/02(月) 18:52:21ID:yBhZfJvB
>>831
紙質にも拠るからコツを掴むまではイライラするかも。
fiとDR-2580使ってきての大雑把な印象としては、
fi=異なった紙質が混載してる時はどうやっても駄目な事がある
DR=ザラザラな紙質に弱い

5010って事は、A3とかも扱うんだろうから、より顕著に起きるんじゃないかね。
0835名無しさん@お腹いっぱい。2006/10/02(月) 20:25:43ID:SxgLd1K0
>>828
残念ながら、ScanSnap Organizerでは、
ScanSnapで読み取ったPDFファイル以外は検索可能なPDFに変換できません。
0836名無しさん@お腹いっぱい。2006/10/02(月) 22:32:48ID:LKU/q17e
>>835
PFUはクソソフトだな。
DR-2050ユーザーの意見。
0837名無しさん@お腹いっぱい。2006/10/02(月) 23:41:52ID:ShpZ6A88
>>836
でもCapturePerfectだってDRで読んだ画像しか
テキスト入りPDFにできないけど……
0838名無しさん@お腹いっぱい。2006/10/03(火) 00:27:19ID:uy1drV74
>>837
そんなことないけど。
別スキャナーで取り込んだ複数のjpgをCapturePerfectに突っ込んで透明テキスト入りのPDFに出来るよ。
0839名無しさん@お腹いっぱい。2006/10/03(火) 00:36:04ID:gBrAxZfI
独自ドライバのSCANSNAPに難癖付けても仕方ねぇべ。

>>837
ISISドライバのあるスキャナならCapturePerfectで読取できるよ。
fiとCapturePerfectの組み合わせで透明テキスト付きPDF作成できた。
画像ファイルも直に出来るとは思わなかった。今度試してみよう。
0840名無しさん@お腹いっぱい。2006/10/03(火) 01:10:06ID:flw8VW5M
最近のスキャナは静かですか?
4年ほど前に複合機買いましたけど
スキャナがとてもプリンタはもちろんスキャナが
とても煩かったです。近所から苦情が来たため数回使ってやめましたが
今のは、どうなのでしょうか?
0841名無しさん@お腹いっぱい。2006/10/03(火) 01:33:17ID:GRB1pxpM
引っ越した方が早いと思うよ
0842名無しさん@お腹いっぱい。2006/10/03(火) 02:00:43ID:flw8VW5M
貧乏なので無理です
引越しできたとしてもたぶん環境は変わらないでしょう
一軒家に住みたいです
あの機会音が無ければなぁーと思います
ウィーン ガチャン ウィーン ピー
もう煩いw最近の機種もあまり音は改善されてないみたいですね
0843名無しさん@お腹いっぱい。2006/10/03(火) 07:35:05ID:+Imzl1xw
防音ブースの中に入れるといいよ
0844名無しさん@お腹いっぱい。2006/10/03(火) 08:19:30ID:7mHpD4DX
デジカメで撮れば?
0845名無しさん@お腹いっぱい。2006/10/03(火) 20:19:45ID:oMRuQwR7
網膜に焼き付けろよ
08463362006/10/03(火) 23:03:01ID:ZfS1Hz3/
PDFに貼り付けた透明テキスト(?)を削除するにはどうしたらいいでしょうか?
OCRをやり直したいんですが…。
0847名無しさん@お腹いっぱい。2006/10/04(水) 03:14:13ID:xlSHEYqc
Adobe Acrobat8ではどう?
0848名無しさん@お腹いっぱい。2006/10/04(水) 11:46:18ID:ApKoMmZe
>>846
むしろそんなことが出来ないとは思ってなかった。自分は。
適当に設定いじれば出来るもんだと思ってた。
けどAcrobat7で試したら自分も分からなかった。
テキスト情報の無いプレーンなPDFに戻すのって結構難しいのかな。
0849名無しさん@お腹いっぱい。2006/10/04(水) 15:34:22ID:eZQ8k9Hz
>>846
ACROBATからだったら、単純にもう一回OCRの実行すれば可能みたい。
特定のテキスト編集したり消すんだったら>>47。
ただし、フォントが埋め込んで無いとエラーが出る。
CapturePerfectから作成したテキストが消せなくて悩んでたら
↓との事。
ttp://support.adobe.co.jp/faq/faq/qadoc.sv?222555+002

...面倒くせぇ。
0850名無しさん@お腹いっぱい。2006/10/04(水) 19:37:31ID:9T4RbjFi
Acrobatならちっとも難しくないぞ。
目的のファイルを開く→「名前を付けて保存」→ファイル形式でJpegを選択
でファイルの全ページをJpeg化できる。
再度AcrobatでPDFにし直すのもよし。再度OCRソフトに読み込ませてもよし。

バッチシーケンス使えばもっとスマートに出来るかもしれん。
0851名無しさん@お腹いっぱい。2006/10/04(水) 20:54:40ID:1oJLYW8b
Photoshopで読めば?
08523362006/10/05(木) 06:03:48ID:ceWV8kNr
>>850
その時、画像が劣化しませんか?
0853名無しさん@お腹いっぱい。2006/10/05(木) 08:20:38ID:k2ObmtME
なんで?
0854名無しさん@お腹いっぱい。2006/10/05(木) 11:56:15ID:yhQuUnqz
方法は教わったんだから自分でやってみりゃいいじゃねぇか
0855名無しさん@お腹いっぱい。2006/10/06(金) 03:12:14ID:Co1ZxjD7
お前に言われる筋合いはない。引っ込めクズ。
0856名無しさん@お腹いっぱい。2006/10/06(金) 03:59:52ID:L9QD0AFI
とゴミ屑が申しております
0857名無しさん@お腹いっぱい。2006/10/06(金) 04:33:14ID:zKXoZGBs
たしかに画像が劣化するよな
0858名無しさん@お腹いっぱい。2006/10/06(金) 13:13:17ID:u/Mns1Wo
JPEG化するときに劣化するのではない
PDF作成時にサイズ最適化とかすると多少劣化させた画像が取り込まれるが
それを忠実に吐き出してるだけ
0859名無しさん@お腹いっぱい。2006/10/06(金) 14:34:58ID:POuJpknZ
Capture Perfect V3.0.31バージョンアップデータ
http://cweb.canon.jp/drv-upd/dr/cp3031ud.html
0860名無しさん@お腹いっぱい。2006/10/06(金) 16:13:22ID:UqkWOs9H
>>858
ACROBATからJPGで保存にすると、再圧縮かけて劣化するべ。
無劣化でJPG書き出しする方法ガあれば教えて欲しい...

>>859
Capture Perfect側では傾き補正できない様にした、って事かなぁ。
それはそれで極端な...
0861名無しさん@お腹いっぱい。2006/10/06(金) 16:36:43ID:jj7csa4O
>>859
>●V3.0.30→V3.0.31へのバージョンアップ内容
>1.OCR情報付きPDFファイルを作成する際、自動的に斜行補正が働く仕様
>  だったため、原稿によっては意図せず画像が斜行してしまうケースが
>  ありました。これを自動的に斜行補正を働かせない仕様に変更致しま
>  した。斜行補正を併用したい場合はスキャナドライバ設定にて有効に
>  して下さい。

斜行補正の精度を上げるという選択肢はないのかCANON。
0862名無しさん@お腹いっぱい。2006/10/06(金) 22:06:41ID:mInkeDQh
>>860
>ACROBATからJPGで保存にすると、再圧縮かけて劣化するべ。
しませんよ。
0863名無しさん@お腹いっぱい。2006/10/06(金) 22:15:34ID:rvoHgLZ7
2050Cで一番斜行がましになるのはどの方法かな?

Capture Perfect。
アクロバット経由。
それともOCRソフト経由

神業の洗濯バサミと30枚しかのせてなくて
ガンマ値もいじってない。
白地の書籍をスキャンしてるのに
酷いときは酷いよ。
0864名無しさん@お腹いっぱい。2006/10/06(金) 22:35:02ID:vXlLNLxd
補正オンで縁ベタ原稿だけあとでとりなおす
0865名無しさん@お腹いっぱい。2006/10/06(金) 23:24:27ID:yP6XPnPO
>>860
これは間違いなくあり得ない。Adobeもそういってる。
JPEG→PDF→JPEGで画質の劣化は起きないよ。

ただしOCRかけたり、最適化オプションで画像解像度を落とすと
当然劣化する。でもただPDF化しただけのものなら、劣化無しに元のJPEGに戻せる
0866名無しさん@お腹いっぱい。2006/10/06(金) 23:29:16ID:yP6XPnPO
>>861
スキャナドライバ側の斜行補正とCapturePerfect(のOCRエンジン)の斜行補正と
どっちが賢いかって言うと、ドライバの方がちょっと賢いような気がする。

でもこれまではPDFにするときはドライバの斜行補正はOFFにしとくしかなかった。

今度は逆にOCRエンジンの斜行補正がOFFになるってことやね。
選択肢としては正しいかも。黒枠が切れる?明るさを192まで上げろって
08678602006/10/07(土) 00:59:48ID:vSW81fkm
>>862
>>865
ん?普通にファイル→名前を付けて保存でファイル形式jpg選ぶんだよね?
最高品質に設定してもpng出力とくらべると多少変質してるみたいなんで
再圧縮かけてるのかと思ったんだが...
acrobat以外で生成したpdfだとダメ、とか条件があるのかなぁ。
ちょっと調べてみよう。

>>866
スキャナドライバ側の斜行補正=紙端検知
CapturePerfect(のOCRエンジン)の斜行補正=文字並び検知
じゃなかったっけ?どっちが良いかは原稿種に拠るんじゃね?
選択肢は残しといて欲しいなぁと思ったんだが...
0868名無しさん@お腹いっぱい。2006/10/07(土) 07:31:57ID:vSW81fkm
>>867自己レス。
pdfから画像抽出するソフトやacrobatからアドバンスト→画像の書き出し使ったら
無劣化jpg書き出し出来たっぽい。acrobatの方は少々怪しいけど。
acrobatから名前をつけて保存、だと複数画像だろうがテキストだろうがページ毎に
一まとめにして画像として保存するから再圧縮かかるって事になるのかな。
>>852じゃないからとりあえず無劣化抽出できれば満足。スレ違いスマソ。
0869名無しさん@お腹いっぱい。2006/10/07(土) 16:35:12ID:hL9MFjYE
>>865
便乗質問ですが、AcrobatでOCR化しただけでなんで劣化するのですか?
実は前から気になってることで、OCR化後のPDFの容量が思いっきり小さくなるので(5分の1くらい)、
なんとなく気持ち悪かったんですよ。
透明テキストを貼り付けてるならむしろ容量増えるべきだろ?と。
0870名無しさん@お腹いっぱい。2006/10/07(土) 21:11:47ID:jHt2Xs2p
>>869
高解像度で取り込んで作ったきれいな絵のPDFにOCRかけてみな
汚くなるから、

方法はあるのかも知れないが、結構いじったがわからんかった。
08718702006/10/07(土) 21:23:05ID:jHt2Xs2p
>>869
失礼、これでは伝わらんな、

OCR後は、よく見ると確実に絵が汚くなっている。
文字の周りにノイズがのったり、印刷絵の網網も劣化している、
よって小さくなるのだろう。

いろいろ設定を変えてやってみたのだが、、、、

0872名無しさん@お腹いっぱい。2006/10/07(土) 22:12:00ID:mKm9fhoc
>>869は劣化するのはわかってて理由を訊いているのでは
0873名無しさん@お腹いっぱい。2006/10/07(土) 22:41:26ID:hL9MFjYE
>>872
あ、代弁ありがとうございます。

OCR化で劣化してることには気づいていており、設定変更では私の調べた限り対処は出来ませんでした。
で、気になるのが、何がどういう理由でOCR化するにあたって画像を劣化させる必要があるのか?ということが疑問だったのです。

今までOCR化はAcrobatでしか行ったことがないのですが、他のソフトの事情はどうでしょう?
08743362006/10/08(日) 09:21:59ID:KeueR/7+
気になりますね。
テキストデータを付加するだけでなんで画像まで劣化するのでしょうね。
0875名無しさん@お腹いっぱい。2006/10/08(日) 10:15:17ID:KRAaSbd4
単純に再圧縮しているという仕様という名のバグ。
0876名無しさん@お腹いっぱい。2006/10/08(日) 11:47:58ID:RtdogS0I
ある程度の解像度は文字認識に必要だが、OCRが済んでしまえば
高画質である必要は無いから、再圧縮してPDFのファイルサイズを
出来るだけ小さくしようという考えなんじゃないかな。
ファイルサイズが大きいとメモリを消費して操作も一層重くなるし。
0877名無しさん@お腹いっぱい。2006/10/08(日) 12:55:37ID:3w3LguV8
OCR前後でサイズはどれぐらい変化するのですか?

0878名無しさん@お腹いっぱい。2006/10/08(日) 14:50:18ID:iiRXv7Ew
>>869
ダウンサンプリングで劣化の度合い変わるんで、
何割もファイルサイズ落ちるんだったらそこを低くするのも手かと。
最低にしても多少は劣化してるみたいだけど。試し済みならスマヌ。

確かACROBATって読んでココのOCRエンジン積んでたと思ったんだけど、
こちらも同じ仕様なのかしらん。
0879名無しさん@お腹いっぱい。2006/10/08(日) 17:18:30ID:rlMAr23d
>>878
OCRエンジンは認識するだけだろ。
画像側を再圧縮するかしないかなんてAdbe側の仕様
0880名無しさん@お腹いっぱい。2006/10/08(日) 20:08:22ID:fmeTwQ6i
http://www.g-mark.org/search/Detail?id=32135&lang=ja
0881名無しさん@お腹いっぱい。2006/10/08(日) 21:06:52ID:ml9c+sg+
AcrobatはOCRかけるときにいったん、ラスター画像として書き出して、
それに対してOCRをかけ、透明テキストをかぶせる際に画像を再圧縮している。
再圧縮の設定は「テキスト認識」の設定で「PDFの出力形式」で「検索可能な画像(非圧縮)」を
選んでも、その下に「画像のダウンサンプリング」とあるとおり、再圧縮は免れない。
http://support.adobe.co.jp/faq/faq/qadoc.sv?225546+002

「画像のダウンサンプリング」で「最低(600dpi)」を選んでも、かなり汚くなると言う印象。

PDFにただOCRかけるだけなら読んde!!ココの方が綺麗に仕上がる。
(エンジンのバージョンが違うからか、それともAcrobat独自の問題か)

読んde!!ココの設定は「オプション−環境設定−出力」の「画像領域の設定−画像の出力解像度」を
「元画像の解像度」にしておけばいい。
0882名無しさん@お腹いっぱい。2006/10/08(日) 22:51:04ID:pYmZMzob
>>881
詳しくありがとうございました。
読んでココを試してみたいと思います。

ただ、OCR化するような文字がたくさんの本を200dpiや300dpiのPDFで保存し続ける必要性があるのか?
と言われれば、Acrobatに右へならえしたほうがいいのですがw
0883名無しさん@お腹いっぱい。2006/10/09(月) 12:13:04ID:z4tsizML
必要があるのか、なんてのは人それぞれだろ。余計なお世話だ。
氏ねよクズ>>882
0884名無しさん@お腹いっぱい。2006/10/09(月) 20:58:24ID:63+jhuUe
>>883 最近は、夏休みの宿題が終わらなかったり、18才で童貞ってだけで自殺しちゃう
人居るから軽いジャブの気持ちでも、気をつけなよw
0885名無しさん@お腹いっぱい。2006/10/09(月) 22:48:39ID:rNrW5aZQ
>>882の「必要があるのか?」は自分へのツッコミだろ
何でお前が切れてんだ
0886名無しさん@お腹いっぱい。2006/10/09(月) 22:52:21ID:oHQuyCHS
なんでだろ?
0887名無しさん@お腹いっぱい。2006/10/09(月) 23:11:13ID:mOLt1RJ3
>>885
そうです。自分へのツッコミです。
0888名無しさん@お腹いっぱい。2006/10/10(火) 00:54:50ID:OjYMUDI2
コミュニケーション能力がない人間の勝手に誤解して勝手に暴走して
周りに疎まれてやがて孤立する黄金パターンを地でいってるな。
0889名無しさん@お腹いっぱい。2006/10/10(火) 02:53:00ID:VTgybICt
時々湧いてるage荒らしじゃん。近寄っちゃいけません。
0890名無しさん@お腹いっぱい。2006/10/10(火) 16:05:50ID:KAOUvVlx
僕は・・・、



いつでも君のそばにいるよ。>>889
08913362006/10/11(水) 09:39:52ID:GWsVyV36
adobeのOCRを使うと再圧縮は免れない、と言うことでいいのでしょうか?
0892名無しさん@お腹いっぱい。2006/10/11(水) 11:19:33ID:ks3l/SRv
>>891
AdobeだけじゃなくOCR→透明テキスト処理をすると
必ず画像はリサンプリングされる。
ただ、Acrobatは特に汚く(ただしサイズは小さく)なる
08933362006/10/11(水) 18:37:43ID:GWsVyV36
PFUに電話しました。
scansnap organizerのOCRは画像データをいじらないそうです。
でもあやふやそうなおねーちゃんだったので、ちょっと心配です。
08943362006/10/11(水) 18:59:38ID:GWsVyV36
あやふやそうな→言ってることがあやふやな
0895名無しさん@お腹いっぱい。2006/10/11(水) 20:11:53ID:PNPxz7m+
>>893
それは「スキャナから無圧縮状態でOrganizerに送信」→「OCR処理」→「PDF変換」

最後の「PDF変換」の時点でJPEG圧縮が入る、ということでしょう。
あやふやそうなねーちゃんの言ってることを信じてもいいんじゃない?

ただし一度PDFにしたらOCR処理の際には必ずリサンプリングされます。
0896名無しさん@お腹いっぱい。2006/10/12(木) 06:36:06ID:H/KMdv7o
>>893
そんなに気になるのなら自分でカラー原稿1枚試してみるのが
一番早いと思うんだがなぁ...。
organizerからOCRかけたものとかけないものと2回スキャンして有意差あるか、
ついでにどっちかをACROBATで再OCRかけてみてどうか、くらいで。

>>895
S500出る頃に「jpeg画像での読取精度向上技術が云々」とか謳ってたんで
scansnapからjpg転送された画像を元にOCRかけてるかと。
良く解らんが、例えOCR用にリサンプリングされたとしても、
それを最終画像として使うかは別の問題じゃないの?
0897名無しさん@お腹いっぱい。2006/10/12(木) 14:05:02ID:wcjlsRxk
プトレマイオス朝時代のエジプトには、当時世界最大の図書館「アレクサンドリア大図書館」があり、
70万もの蔵書を誇っていたという。
蔵書のほとんどは巻物だったが、1巻200ページ相当として、300dpiでスキャンした場合、1頁500KBとして
1巻100MB、それが70万巻ということは70TBか。
TeraStation 2GBを35台つなげればアレクサンドリア図書館に匹敵するデジタルアーカイブが完成するな。

文字数を見ると、1頁に2000文字のアルファベットが書き込めるとすると、
2000文字×200頁×70万=280,000,000,000文字の知識が詰まっていたということになる。
1文字1バイトなら280GB、UTF-8みたいに1文字3バイトなら840GBか。テキストだけ抜き出せば
個人のPCでも何とかなりそうだな。

さて、これを全文検索かけるとなるとNamazuの場合、対象ファイル数は90万弱が限界みたいだから
http://www.namazu.org/FAQ.html#index-scale
何とかなるかも。
Hyper Estraierの場合、
http://hyperestraier.sourceforge.net/uguide-ja.html#tips
にあるように「一つのインデックスに登録できる文書の総量の目安は、プレーンテキストなら300GB」
とのことなので、1文字1バイトならぎりぎりいけそう。UTF-8なら3つくらいにインデックスを分けて
P2P連係させないといけなくなる。
0898名無しさん@お腹いっぱい。2006/10/12(木) 14:19:54ID:wcjlsRxk
Acrobat 7.0でOCRかけると画質は落ちるくせにサイズが膨らむ場合がある。
そういう場合、「アドバンスト→PDFの最適化」で「スペースの使用状況を調査」ボタンを押してみるといい。
「画像」の比率が99%以上なら正常だけど、「文書のオーバーヘッド」の比率が高いと無駄に要領を
食われていることになる。

そんなときは「PDFの最適化」画面はいったん「キャンセル」で閉じて、「名前をつけて保存」してみる
するとオーバーヘッドが最適化されて適正なサイズになっている。
この際に画質劣化や透明テキストに手が加わってるなんてことはないのでご安心を
0899名無しさん@お腹いっぱい。2006/10/12(木) 14:25:24ID:EoohFZsj
「pdfの最適化」が付いてるのはproだけだけどなw
0900名無しさん@お腹いっぱい。2006/10/12(木) 20:57:17ID:DS8jrcs+
>>899
価格改定で安くなってる。
0901名無しさん@お腹いっぱい。2006/10/12(木) 22:33:54ID:3u72xnVY
>>897
600dpiならその4倍。
0902名無しさん@お腹いっぱい。2006/10/14(土) 23:51:46ID:w6NPIpZj
A4の両面白黒ものを何枚もスキャンして
プリンターで印刷するという使い方をしようと思っています(つまりコピー)。

会社などにある自動送り方式形のスキャナがあると噂で聞いてやってきたんですが、
こういう種類のもので入門機といえばどこのメーカーのものになるのでしょうか?

加えて年賀状の送り名もスキャンできてデーター化できたりしたら最高なんですが・・。
0903名無しさん@お腹いっぱい。2006/10/15(日) 00:13:11ID:gwHJXdwE
>>902
ScanSnap s500 は?
0904名無しさん@お腹いっぱい。2006/10/15(日) 02:42:30ID:Y5duL8R1
>>902
コピー機代わりがメインで、一回のスキャン枚数が十枚以下とか
いっそのことADF付き複合機とかは?

ADF付きスキャナ専用機だと、PFUのSCANSNAPかCANONのDR-2050が4万強で安いほう。
SCANSNAPは1ボタンでPDF化できるお手軽さはあるけどコピー用途には一手間要るかも。
DRはスキャナと連動してコピー機代わりにできる付属ソフトが付いてる。

ただ...どちらも葉書のスキャンって出来たっけ?
0905名無しさん@お腹いっぱい。2006/10/15(日) 02:54:47ID:HPdYmNEn
今度出るX5470って複合機、ADF付きスキャナとして見れば安くない?
もちろん、印刷はしない方向でw
0906名無しさん@お腹いっぱい。2006/10/15(日) 14:13:09ID:qEyftDOk
>>904
>どちらも葉書のスキャンって出来たっけ?
DR2050の場合、紙面がつるつるだと(年賀状、絵葉書などの印刷、写真)、
すべってよみこめなかったり
黒が濃すぎると(まっくろ)読み込んだ画像がおかしくなる。
scansnapは使ったことがないのでわからず
0907名無しさん@お腹いっぱい。2006/10/15(日) 18:09:49ID:JJaSIsk0
写真ハガキは貼り合わせのせいでは
0908名無しさん@お腹いっぱい。2006/10/15(日) 20:39:12ID:sD9wMHm5
http://www.pfu.fujitsu.com/imaging/news/ss-gooddesign.html
レス数が900を超えています。1000を超えると表示できなくなるよ。