シェルスクリプト総合@LINUX Part3
■ このスレッドは過去ログ倉庫に格納されています
0001login:Penguin
2007/07/10(火) 23:17:13ID:qGthZdMEまあそれはそれとして、BASHウゼーとか言われる心配なく
平和にLINUX的スクリプト談義しましょうよ。
初めての自作スクリプト、自信ないから見てください。な初心者から
トリッキーな技を駆使した作品を披露したい、蘊蓄を語りたい上級者まで
いろいろな人に参加して頂けると嬉しいです。
perlやらPythonやらの話が混ざっても良いんでない?
【sed】シェルスクリプト総合@LINUX Part2【awk】
http://pc11.2ch.net/test/read.cgi/linux/1154578200/
http://pc8.2ch.net/test/read.cgi/linux/1121994321/
>>2-5あたりに色々と。
0084login:Penguin
2007/08/30(木) 01:02:14ID:F11xsKF5イメージ的には、こんなことがしたいんです↓
----------------------------------
hoge="1.3.37"
foo="1.11.12"
if [ "$hoge" -gt "$foo" ]; then
echo "OK"
else
echo "NG"
fi
----------------------------------
これだと、以下のようjにエラーになってしまいます。。。。
[: 1.3.37: bad number
NG
0085login:Penguin
2007/08/30(木) 04:22:00ID:GmS5dPb3foo="1.11.12"
hoge=`echo $hoge | gawk -F. '{print (($1*100+$2)*100)+$3}'`
foo=`echo $foo | gawk -F. '{print (($1*100+$2)*100)+$3}'`
if [ "$hoge" -gt "$foo" ]; then
echo "OK"
else
echo "NG"
fi
ピリオド区切りの数が固定(この場合は3)
ピリオド内の桁数が固定(この場合は1-2桁)
という条件付だけど。これらが不定なら、$1,$2,$3...を$iにして、
NFまでループさせればいいと思う
0086login:Penguin
2007/08/30(木) 07:19:55ID:QpfKAJKgoldv=1.11.12
newv=1.3.37
として
if [ `echo $newv -gt $oldv | sed 's/\.//g'` ]; then
echo OK;
fi
もしくは、
if [ `echo $newv.$oldv | tr . ' ' | xargs printf "%d%.3d%.3d -gt %d%.3d%.3d"` ]; then
echo OK
fi
あたりでどうかな。
0087login:Penguin
2007/08/30(木) 18:00:56ID:bHskgKzhrpmver ってのがある。
$ rpmver -v 1.3.37 1.11.12
RPM version 1.3.37 is lesser than version 1.11.12.
Vine,VineSeed の RPMS.main SRPMS.main にある。
他のディストリは知らないけど
パッケージが用意されてるかもしれない。
0088login:Penguin
2007/08/30(木) 23:05:03ID:nhWZyH15rpmver not found
うえーん。。。
0089login:Penguin
2007/08/31(金) 00:47:12ID:U99N+hxPLinux板だからbashでもいいよね。
#!/bin/bash
v2n () {
local IFS=.
set $1
echo -n $(($1 * 1000000 + $2 * 1000 + $3))
}
hoge="1.3.37"
foo="1.11.12"
echo $(v2n $hoge) $(v2n $foo)
if [ $(v2n $hoge) -gt $(v2n $foo) ]; then
echo "OK"
else
echo "NG"
fi
添削してぇ
009173ですが
2007/09/01(土) 22:39:45ID:uwRTp3HZ仕様はおっしゃるとおりです。
その際のスクリプトも教えてくだされば幸いです。
なお、他のスクリプトは現在のところ動作していません。わたしの知識不足なのだろうと思うのでもうすこし調べてみます。
#0は補ってはあるのですが...
ついでといってはなんですが、awkの本でおすすめの本などありましたら教えていただけませんか?
0092login:Penguin
2007/09/02(日) 04:19:30ID:WMH1r7G1オライリーの sed & awk
てかawkの本なんて何冊もないって。
0093login:Penguin
2007/09/02(日) 08:46:56ID:ToB27R8d大穴 awk 256 本
0094login:Penguin
2007/09/02(日) 20:47:44ID:VmAuZafy「正規表現」「連想配列」という二つのキモを学習するにふさわしい内容。
読み終わったあとも、巻末の関数一覧がずっと使える。未だに刷を重ねてるけど
愛用者もおおいんじゃない?
大して御本家3人の書いたawk本は内容が高度な上に散発的で、調べたいことが
すぐに出てこなくて使いにくい
>>91
>>76のがその仕様のスクリプトなんだけど。うまく動かないのは、スペースとかが
ちゃんとコピペされてないからなんじゃないの?
009573ですが
2007/09/02(日) 21:37:03ID:71yMDj2y本の紹介ありがとうございました。
>>94
気づきませんでした。すいません。スペースの問題などを再確認してみます。
またなにかあったら伺うかもしれません。よろしくおねがいします。
0096login:Penguin
2007/09/02(日) 21:40:05ID:QLbcFUyG0097login:Penguin
2007/09/02(日) 21:55:05ID:ToB27R8d0098login:Penguin
2007/09/02(日) 22:03:47ID:VmAuZafyそう。今の版じゃ改訂されてるのかもしれないが、俺の持ってるのだと
gawkをDOSに移植したjgawkとかいうのを下敷きにしていて、中には486を乗せたキューハチだと
スクリプトの速度が向上したとか、パイプの実行速度が遅いのはUNIXみたいな本物のパイプじゃないからとか、
そんな話題が満載
0099login:Penguin
2007/09/02(日) 22:04:37ID:QLbcFUyG0100>>84
2007/09/04(火) 00:34:58ID:3rxVdbk90101login:Penguin
2007/09/06(木) 08:15:09ID:33eRwNa2/data/ をTOPディレクトリとしますと
/data/hoge/
/data/piyo/
/data/moge/
等が帰ってくるコマンドです。で、この際 /data/hoge/direc/ みたいに、TOPディレクトリの
孫ディレクトリ以下は返さないで欲しいんです。TOPディレクトリの子ディレクトリのみを
返して欲しいのです。そして for TARG in command; do 処理; done のように
for文で1つ1つのディレクトリを処理したいのです。
それからもう1つ、指定されたディレクトリ以下の子ディレクトリの数を返すには
ls -l /data/ | grep ^d | wc -l
でいいのでしょうか?ディレクトリだと ls -l した時に必ず最初が dから始まるので
これでディレクトリのみがマッチして、後はwcでその行数を数えればいいかと思っているのですが
今の所これでちゃんと動作していますが、不具合が発生するようなケースは想定されますか?
ディレクトリの数も孫ディレクトリ以下は数えません(再帰処理しない)。
昨日 basename と言う便利なコマンドを知った程度のレベルの人間ですので
awk や sed 等の難しいコマンドはなるべく使わずに実現したいのですが、出来ませんかねぇ?
宜しくお願い致します。
0102login:Penguin
2007/09/06(木) 08:27:57ID:QTrKtnCGls -d /data/*/
0103login:Penguin
2007/09/06(木) 08:30:08ID:QTrKtnCG0104login:Penguin
2007/09/06(木) 08:31:55ID:33eRwNa2あっちゃー・・・・そんな簡単なコマンドでこんな素晴らしい出力が得られるんですか!
LinuxのCUIって本当に高機能ですね・・・素晴らしいです。本当にありがとうございます。
ls -l /data/ | grep ^d | wc -l
ってやるより
ls -ld /data/*/ | grep ^d | wc -l
ってやる方が良いのでしょうか?どんなファイルやディレクトリがあっても確実に動作するような
書き方をしたいのですが・・・。
0105login:Penguin
2007/09/06(木) 08:32:01ID:QFjDOBHfls -d /data/*|grep "^d"
0106login:Penguin
2007/09/06(木) 08:33:56ID:QFjDOBHf0107login:Penguin
2007/09/06(木) 10:26:24ID:QTrKtnCG> ls -ld /data/*/ | grep ^d | wc -l
なんで grep するんだ?
0108login:Penguin
2007/09/06(木) 11:58:40ID:rZQRUej8/data/../ もヒットするのが難点だけどな。ってかあれだ。つ「man ls」
0109login:Penguin
2007/09/06(木) 16:47:27ID:40ywKZW4求めてることが出来たのであればどんなコマンドでもいいけど
find の使い方も知っておいたほうがいいと思う。
> 不具合が発生するようなケースは想定されますか?
> ディレクトリだと ls -l した時に必ず最初が dから始まる
ディレクトリへのシンボリックリンクがあった場合の扱いをどうするか。
さらに言えばリンクの対象がどこにあるか
ln -s /data/A /data/B と ln -s /tmp/C /data/B の違いとか。
0110login:Penguin
2007/09/06(木) 16:55:32ID:QTrKtnCGでよかったか。
>>109
> find の使い方も知っておいたほうがいいと思う。
同意。
0111login:Penguin
2007/09/06(木) 17:08:55ID:ZccH/OF/101への課題?
0112login:Penguin
2007/09/06(木) 20:00:39ID:QTrKtnCGそれもあるし、単にめんどうだし。
0113login:Penguin
2007/09/07(金) 11:30:33ID:BZSReuYlfind /data -type d -maxdepth 1
0114109
2007/09/07(金) 17:14:59ID:NgwMB5/h二ヶ所で減点。
1) find の出力に TOPディレクトリ(/data 自身)も含まれてる。
>>101 を読むとTOPディレクトリそのものは不要だと思う。
2) GNU find version 4.2.27 だと -maxdepth の位置で warning が出た。
find: warning: you have specified the -maxdepth option after a non-option argument -type, but options are not positional (-maxdepth affects tests specified before it as well as those specified after it). Please specify options before other arguments.
0115login:Penguin
2007/09/07(金) 17:35:19ID:BZSReuYlなるほど。非常に参考になった。
模範解答を頼む。
0116login:Penguin
2007/09/07(金) 17:39:52ID:aiZtBudzもう一回自分で書いてみたら?
0117login:Penguin
2007/09/07(金) 19:24:55ID:Txvf/Wl4shopt -s nullglob
for i in /data/{,.{[!.],.?}}*/
do ...
こんなんでいかが
0118login:Penguin
2007/09/07(金) 19:45:52ID:ezpNZgi5に似ている。
0119login:Penguin
2007/09/07(金) 20:30:25ID:BZSReuYlOK。これでどうだ?
find /home/* -maxdepth 0 -type d
0120login:Penguin
2007/09/08(土) 04:46:18ID:WlyFgm6n>>119
/home/.xxx/ とかが出ない。
* 使うなら find 使う意味ない。
0121login:Penguin
2007/09/08(土) 14:42:47ID:vllGfkN4>* 使うなら find 使う意味ない。
上下別々の回答なんじゃないの?
0122login:Penguin
2007/09/11(火) 03:08:21ID:997sWGjJ0123login:Penguin
2007/09/12(水) 11:40:47ID:EatE1MlGls *.dat > list.txt
なぜか走らん。
0124login:Penguin
2007/09/12(水) 17:16:53ID:A49nKXNq子プロセスとして(?)起動するシェルに -f が渡らないんだと思う。
/bin/sh -f hoge.sh とか
あらかじめ /bin/sh -f で起動したシェルで
./hoge.sh みたいにすると
-f が有効になる。
0125login:Penguin
2007/09/12(水) 17:21:21ID:EatE1MlGエラーで *.dat: ファイルもディレクトリもありません とでる
ワイルドカードが原因かと思ったけど、hoge*でも同様のエラー
シェルにしたら走らず、コマンドラインで直接投げたら走る
なんでだろ
0126124
2007/09/12(水) 17:27:12ID:A49nKXNq/bin/sh -f の -f がどんな意味かわかってる?
あと、シェルとシェルスクリプトはちゃんと区別したほうがいい。
0127login:Penguin
2007/09/12(水) 17:33:44ID:EatE1MlGコンソールがcshだった
0128login:Penguin
2007/09/12(水) 20:01:20ID:9HkBr7tDpasswd_Aのものだけを残すというようなことをしたいのですがどうすればよいでしょうか?
0129login:Penguin
2007/09/12(水) 20:12:55ID:nfcPR4Gc一行ずつ上から順に読んでパスワードファイルに書き込む
書き込んだらそのユーザー名を別ファイルに書き出す
その別ファイルにユーザー名がないことを確認してから
パスワードファイルに書き込めばよい
0130login:Penguin
2007/09/12(水) 22:19:22ID:qqfxe9V8if [ "`grep ^${t%%:*}: passwd_A`" ];then
continue
else
echo $t >>passwd_A
fi
done <passwd_B
0131login:Penguin
2007/09/12(水) 22:53:21ID:SML918nzawk -F: '{
t[$1] = $0;
}
END {
for (e in t)
print t[e];
}' passwd_B passwd_A
0132login:Penguin
2007/09/12(水) 23:49:46ID:lhLTsTba0133login:Penguin
2007/09/13(木) 21:53:28ID:8j1+julM20070109,170000,170000,167000,170000,4
20070110,168000,168000,168000,168000,10
20070115,171000,171000,163000,169000,500
を
2007/01/09,170000,170000,167000,170000
2007/01/10,168000,168000,168000,168000
2007/01/15,171000,171000,163000,169000
のように
YYYY/MM/DDと表示を変更する
最後の,からあとを削除してbbb.txtとして出力したいと思っています
どのようにすればいいものでしょうか
4文字目と5文字目の間に/を挿入するということがsedでできなくて悩んでおります
よろしくお願いいたします
0134login:Penguin
2007/09/13(木) 22:06:02ID:OVx1tSlg0135login:Penguin
2007/09/13(木) 22:08:03ID:G9V8Phhbグルーピングしたパターンは後で\1,\2で参照出来る。
\を忘れるなよ。
0136login:Penguin
2007/09/13(木) 22:09:20ID:G9V8Phhb0137login:Penguin
2007/09/13(木) 22:25:32ID:8j1+julMありがとうございます
gwakというのも勉強してみようと思います
0138login:Penguin
2007/09/13(木) 22:52:13ID:8j1+julMmanを見てみたら いろんなところで使用できそうです
本当にありがとう
0139login:Penguin
2007/09/13(木) 23:24:02ID:saILvvtfcatは要らんだろ。
0140login:Penguin
2007/09/14(金) 00:50:00ID:uh85VpLs0141login:Penguin
2007/09/14(金) 12:28:52ID:hH9EcwDJps aux | grep XXX | grep -v grep | awk '{print $2}' | kill
ではだめなのに
ps aux | grep XXX | grep -v grep | awk '{print $2}' | xargs kill
ではOKなのはなぜですか?
0142login:Penguin
2007/09/14(金) 12:34:24ID:18sjQ9F0kill って標準入力を受け付けないんじゃない。
ところで pkill XXX じゃだめなの?
0143login:Penguin
2007/09/14(金) 12:37:30ID:hH9EcwDJそうなのかなと思って
for p in $(ps aux | grep XXX | grep -v grep | awk '{print $2}'); do
kill "$p"
done
ってのもやってみたんですが、だめだったんですよ。
0144login:Penguin
2007/09/14(金) 17:32:35ID:Ney/3ygS一定間隔ごとに単純にコマンド出すだけじゃなくて
処理ごとに条件分岐してタイマーを止めたりコマンドが成功
するまで繰り返したりしたいのですが
0145login:Penguin
2007/09/14(金) 20:21:33ID:KxObz0sBsleep使って、て程度で良いなら作れるような気しかしないんだけど、具体的にどうしたいのか書いたのが良いと思うぞ。
0146login:Penguin
2007/09/14(金) 20:32:43ID:RM0kquC+どこまで出来たの?
0147login:Penguin
2007/09/14(金) 23:57:41ID:XHXILi6aだめってどうダメだったのかわからんと。
for p in $(ps aux | grep smbd | grep -v grep | awk '{print $2}'); do
"kill "$p"
done
これでやったらちゃんと動いたよ。スクリプトの問題じゃなくて
単に権限がなくてkillできなかっただけでは?
0148login:Penguin
2007/09/15(土) 16:55:13ID:/cIKvz/Tさっきやってみたら出来た。。。
間違って mplayer を40個くらい起動してしまって、そこでそのスクリプトを
叩いたつもりだったんだけど、焦ってなんか間違ってたのかもしれない。
とりあえず今度からは xargs のほうを使うようにするよ。
0149login:Penguin
2007/09/15(土) 17:28:32ID:YiwEKkpX0150login:Penguin
2007/09/15(土) 17:49:23ID:X+i1f7J3例
cat hoge.txt | grep piyo
書き方があるじゃないですか? cat hoge.txt で出力される標準出力をパイプかませて
その出力内容に対して grep piyo をかける と言うような。
これと
xargs ってコマンドがあるじゃないですか?その違いがよく分からないのですが・・。
cat hoge.txt | xargs grep piyo
みたいな?
0151login:Penguin
2007/09/15(土) 18:13:14ID:YiwEKkpX0152login:Penguin
2007/09/15(土) 18:42:58ID:X+i1f7J3ほぉほぉ・・・・
cat hoge.txt | xargs grep piyo が
grep piyo `cat hoge.txt`
と同じならば
cat hoge.txt | grep piyo
は
grep piyo hoge.txt
ん?なんか混乱してきた・・・イマイチはっきりと分からない・・・
0153login:Penguin
2007/09/15(土) 19:03:27ID:8eNJORpcその場合hoge.txtの中身はファイル名でないとだめ
0154login:Penguin
2007/09/15(土) 19:15:07ID:jJyNjt7Iecho 'file1 file2 hoge' | xargs rm
↓
rm file1 file2 hoge
0155login:Penguin
2007/09/15(土) 19:47:59ID:X+i1f7J3echo `file1 file2 hoge` | xargs rm
が
rm file1 file2 hoge
となるならば
echo `file1 file2 hoge` | rm
は
どう展開されるんですか? すみません、ほんと頭弱くて。
0156login:Penguin
2007/09/15(土) 19:51:39ID:YiwEKkpXごちゃまぜの段階でしょ?まずそれを考えてみるんだ>155
0157login:Penguin
2007/09/15(土) 23:18:03ID:+DsxitZ3>>155の echo `file1 file2 hoge` | xargs rm
どこが違うか理解してからにしろ
0158login:Penguin
2007/09/15(土) 23:25:38ID:PpA5ThvC0159login:Penguin
2007/09/16(日) 01:01:56ID:S5o7UTSR0160login:Penguin
2007/09/16(日) 01:06:18ID:BSYCrrV+0161login:Penguin
2007/09/17(月) 04:16:34ID:nqz563FTで、再帰的にカレントディレクトリ以下のファイル、ディレクトリ全てに対して
sjisからutf-8に変換をかけるコマンドを打ったのですが、sjisとeuc-jpが混在していて
convmvの仕様だと 1ファイルでも -f で指定した文字コード以外の文字コードのファイルが
存在した場合はそこで全ての変換処理が実行されなくなってしまいます。
違う文字コードの場合は除外して残りを全て処理してくれるオプションは無いかとman convmv
を読んで見ましたが、無いようです。
仕方が無いので、これをシェルスクリプトで実現したいと思います。
実際にやりたいコマンドは
convmv -r -f sjis -t utf-8 /data/* --notest で、これで変換できないファイルは
convmv -r -f euc-jp -t utf-8 /data/* --notest で、全てのeuc-jpとsjisをutf-8にする事です。
for TARG in `find /data | nkf -w8`
do
convmv -f sjis -t utf-8 ${TARG} --notest
convmv -f euc-jp -t utf-8 ${TARG} --notest
done
これで、sjisのファイルだろうがeuc-jpのファイルだろうが必ずutf-8になると思われますが
いけると思いますか? | nkf -w8 をかませているのは、こうしないとターミナルで見た限りだと
文字化けしたファイル名でそのまま表示されるので、これだと多分ファイルにアクセスできないだろう
との配慮から、ちゃんとしたファイル名で見えるようにしたつもりです。
0162login:Penguin
2007/09/17(月) 08:49:52ID:hnYIly1Tqkc最強伝説
0163login:Penguin
2007/09/17(月) 11:57:35ID:nqz563FThttp://hp.vector.co.jp/authors/VA000501/
これですよね?
しかしこれはconvmvとは全く別物のようです。
convmv => ファイル"名"の文字コードを変換する ←私はコレが必要
qkc => テキストファイルの"中身"の文字コードを変換する ←これは違う・・・
なので使えないみたいです。
ちなみに >>161で書いたスクリプトを実際に動かしてみた所、LinuxサーバのCPU使用率が
100%になって固まっちゃいました。無限ループをしているかファイル名取得に失敗しているか
よく分かりませんがダメでしたOTL
0164login:Penguin
2007/09/17(月) 12:18:44ID:CDwJTqgj0165login:Penguin
2007/09/17(月) 12:56:16ID:RA5G8Fdpconvmv -f euc-jp -t utf-8 -r /data --notest
done
なんか、どうよ?
文字コード判定がいまいちなのか誤認してくれたりするので --notest とって、ざっと眺めてからやる事を推奨。
0166login:Penguin
2007/09/17(月) 13:00:08ID:85s13mgP0167login:Penguin
2007/09/17(月) 13:21:00ID:hplwR1nRで結果に乱数を返したいんですけど、
0〜9までの一桁の結果のみ返したい場合の指定方法とかってありますか?
0168login:Penguin
2007/09/17(月) 13:53:15ID:MlIRuyKv0169login:Penguin
2007/09/17(月) 15:09:07ID:nqz563FTnkf はファイル"名"ではなくて、ファイルの"中身"についての文字コードを
調べるんですよね?テキストファイルに対して実行するとShift-JISと言う出力が得られ、
.exeファイル等に実行すると Binary と表示されました。
なので、これは全く別物です。
>>165
おお・・・
それはつまり
convmv -f sjis -t utf-8 -r /data --notest
で、元ファイルがsjisじゃなかったときは元ファイルがeuc-jpとして処理を繰り返すんですね。
しかしその場合、仮に1つでも元ファイルがsjisだった場合は?と言うか・・・
それ実行してみたのですが、無限ループに陥りました。何度も同じファイルを判定して
これsjisじゃないよ〜って帰ってきます。
よくよく考えると -r /data で既に再帰的に繰り返す処理なのに、それをさらにwhileでループさせて
いるんですよね。二重ループ状態ですか。
while ! convmv -f sjis -t utf-8 -r /data --notest ; do
これで、とりあえず convmv -f sjis -t utf-8 -r /data --notest が実行される
→実行された時に1つでも違うファイルが存在していてエラー
→convmv -f euc-jp -t utf-8 -r /data --notest が実行される
→実行された時に1つでも違うファイルが存在していてエラー
またconvmv -f sjis -t utf-8 -r /data --notest が、最初にエラーで止まったファイルも含んで
最初から実行される>当然また同じファイルでエラーを起こす>convmv -f euc-jp -t utf-8 -r /data --notest が
また実行されてまたこれも最初から処理してしまう>これを永遠に繰り返して無限ループに陥る。
ダメみたいですOTL
>>166
--notestはずして試してみてますが、エラーで弾かれます。
0170login:Penguin
2007/09/17(月) 15:30:26ID:kUn2DAgfいや、ファイル名のコードをnkfで調べりゃいいじゃん、てことだったんだけど。
0171login:Penguin
2007/09/17(月) 15:35:55ID:kUn2DAgffor T in `ls ~`
do
C=`echo "$T" | nkf -g`
echo $T,$C
done
ファイル名の文字コードを調べてると思うんだが。
0172login:Penguin
2007/09/17(月) 16:38:42ID:nqz563FT違うと思うなぁ・・・。
>>171のスクリプト実行してみたけど
これは ls ~ で表示されるファイル名リスト全体、、、そうだなぁ、、例えば
a.txt
b.mp3
c.tar
d.gz
e.tar.gz
とか日本語も含むファイル名全てが列挙されると思うけど、それらのファイル名リスト
全体を1つのテキストファイルとみなして、テキストファイルの中身(つまりファイル名が列挙されてる)
に対して文字コード変換をかけた結果を echo で出力しているんじゃないですか?
だからnkf は ファイル"名"の文字コードを調べるんじゃなくて、あくまでもテキストファイルの中身
の文字コードを調べるんだと思いますが。それこそqkcみたいな動作?
convmvは全くそれとは性格が異なる物だと思いますが、、非常にこの辺ややこしい・・・。
0173login:Penguin
2007/09/17(月) 16:45:55ID:8vN1DPCo0174login:Penguin
2007/09/17(月) 16:47:06ID:rlyHM/pf>>164 の意見を採用して書いてみた。
for を while に変えたのは俺の趣味。
find /data | while read TARG ; do
File=$( nkf -g <<< "$TARG" )
case "$File" in
Shift_JIS*) Code=sjis ;;
EUC-JP*) Code=euc-jp ;;
UTF-8*) continue ;;
esac
echo "$File: Convert to $Code" ## お好みで
convmv -f "$Code" -t utf-8 "$TARG" --notest
done
ファイル名程度の短い文字列だと nkf の文字コード判定の
精度はあまりよくないが、やらないよりはマシだろう。
0175login:Penguin
2007/09/17(月) 16:52:30ID:HxbR0j5Aどうしてそうなったかが気になる
0176login:Penguin
2007/09/17(月) 16:55:54ID:4XOwAbVo起きるな?>混在。
後はデータ中の文字列を元にファイルを作ったりすると、うっかり
混在状態になったり。
0177login:Penguin
2007/09/17(月) 17:22:02ID:kUn2DAgf>>173と同意なんだが、想像の斜め上な方向に理解してるのね。と理解。
なして>>171を実行してみた上で>>172になるのかわからん。。。
つまり、>>172としては、「a.txt あ.txt い.txt」の3つのファイルがあると、
a.txt, ASCII
あ.txt,UTF-8(とか)
い.txt,EUC-JP(とか)
てならず、
a.txt,BINARY
あ.txt,BINARY
い.txt,BINARY
となった、てこと?
>>174
半角カナ使ってなけりゃ、それなりの精度なんじゃねぇかと思うんだけど、どうだろ。
0178login:Penguin
2007/09/17(月) 17:29:26ID:kUn2DAgf↑勘違い。すま。
0179login:Penguin
2007/09/17(月) 19:31:50ID:nqz563FTすみませんOTL。
>>174
そのスクリプト動かしてみたのたですが、 echo ${File}を加えて確認した所
ほとんどのファイルが ASCII と出力されていて、少しだけ Shift-JISという出力が得られました。
って事は?Shift-JISとASCIIが混在しているという事でしょうか?
と言うかそもそもASCIIっていったいどういう・・?
euc-jp sjis utf-8 の3種類しか基本的には知らなくていいと思っていたのですが、4つ目の文字コード
も混在している(というよりeuc-jpのファイルは存在しなくてsjisとASCIIの2つが混在?)と言う事でしょうか。
と言うか convmv --list してみたら asciiってあるし・・・・。
>>176
そうそう、さらにFTPも混ざったりssh + rsyncとかでファイル持ってきたりすると
もう今ぐちゃぐちゃになってて、UTF-8に統一したいんですよ。。。
>>177
.txtの拡張子のファイルは BINARYはでません。
ん?って事は nkf -g ではファイル"名"の文字コードを判別しているって事ですか?
で、その出力がASCIIとShift-JIS、その他としてはBINARYの3種類の状態(だと思う)の場合は
convmv -f ascii -t utf-8
convmv -f sjis -t utf-8
でそれぞれ変換かければいいのかな・・・。なんか難しすぎて頭痛くなってきたOTL。
でもなんか全面的に私が間違っていた感じがするので、その点については皆様方には
大変ご迷惑をお掛けしておりまして申し訳ありません。
0180login:Penguin
2007/09/17(月) 20:51:38ID:kUn2DAgfなんていうか、なぁ。
ASCIIってのは日本語使ってなけりゃASCIIだわな。ちと語弊あるけど。「a.txt」とか。
で、オレの>>177で示したのは、>>174をオレ解釈したところ、
「a.txt」と「(UTF-8な)あ.txt」と「(EUC-JPな)い.txt」が混在してると、いっしょくたになったのが
コード判別にかかって、結局コード判別できなくって「BINARY」って判別されるってことか? と。
オレの説明わかり難かったとは思うけどな。
でもってnkf -gだが、たんに「入力された」のの文字コード体系を調べるだけであって、それが
「ファイルの中身」なのか「ファイル名」なのかは、どっちを指定、てか、nkfに入力したか、て
違いだけ。わかる?
ついでに日本語のファイル名がShift-JISだけなら、SJIS→UTF8に変換指定するだけでokやな。
そんなわけで、まちっと勉強しれ。
0181login:Penguin
2007/09/17(月) 21:22:34ID:rlyHM/pfああ、そういや ASCII を忘れてた。w
解説は >>180 を見てもらうとして、
それを踏まえて >>174 を改良すると、こんな感じかな。
後は自分で調べてみな。
find /data | while read TARG ; do
File=$( nkf -g <<< "$TARG" )
case "$File" in
Shift_JIS*) Code='sjis' ;;
EUC-JP*) Code='euc-jp' ;;
ISO-2022-JP*) Code='iso-2022-jp' ;;
ASCII*|UTF-8*) echo "$TARG: $File"; continue ;;
*) echo "$TARG: $File: Not supported format."; continue ;;
esac
echo "$File: Convert from $Code to UTF-8." ## お好みで
convmv -f "$Code" -t utf-8 "$TARG" --notest
done
>>180
> 「a.txt」と「(UTF-8な)あ.txt」と「(EUC-JPな)い.txt」が混在してると
判定はファイルごとに行うからこれで「BINARY」にはならないはず。
「(UTF-8)あ(EUC-JP)い.txt」とか、複数の文字コードで構成された
ファイル名だと誤判定と言うか、期待通りにはならないと思う。
こういうのもきちんと判定したいのなら ack がお勧め。
こんなファイル名に出くわす事はまずないだろうけどな。w
0182login:Penguin
2007/09/17(月) 22:20:42ID:nqz563FTなるほど、英数字だけの場合はASCIIなんですね・・。
では、 a.txt(ASCIIですよね) を convmv -f ascii -t utf-8 a.txt --notest
なんて有り得ないわけですよねぇ。
BINARYって判別されたのは 例えば vncviewer.exe とかのファイルです。バイナリファイルだし。。。
この結果を見て私は vncviewer.exe と言うファイル名自体は英数字のみなので ASCIIかと
思いますが、しかしvncviewer.exeのファイルの"中身"はBINARYなので、nkf ってのは
ファイルの中身を見てコードを判別して返してくれるんだなぁと思った次第です。
(nkf がファイル"名"を見て返してくれるのなら vncviewer.exeはBINARYではなくASCIIで
かえって来ないといけないからです。) でも nkf に対して何を入力するかによって
返してくるものは違うんですね。ファイル"名"をnkfに入力すればファイル"名"のコードが帰ってくるし
ファイルの内容を入力すればファイルの内容のコードが帰ってくると。
>>181
度々具体的なスクリプトを示して頂いて本当にありがとうございます。
しかしですね・・・よくエラーを見てみると no such file or directory が帰ってきてるんですよね・・・。
つまり find /data をした結果、文字化けしたファイル名が返ってくるわけじゃないですか。
その文字化けしたファイル名の場合、そのファイルにはアクセスする事が出来ないですよね。
文字化けしたファイルに唯一アクセスする手段があるとすれば、それは "*" を使う事ですよね。
だから for や while で1ファイルずつ処理するっていう最初のアイディア自体がそもそも不可能
だったと言う事に今更ながら気づきました。ほんと文字化け問題って大変ですね・・。
"*"を使うと言っても find /data/* だと結局1ファイルずつ文字化けしたものが帰ってくるので
ダメっぽいです。 convmv に 直接 * を渡す必要があるみたいで、そうすると混在している場合に
全く処理をしてくれなくて結局ダメと。。。参ったなぁ・・・OTL。
それと1つシェルスクリプトスレなのでお聞きしておきたいのですが
File=$( nkf -g <<< "$TARG" ) ←これなんですが、 <<< って何ですか?普通 < か << ですよね。
<<<は初めて
0183165
2007/09/17(月) 22:30:38ID:RA5G8Fdpエラーの起こる直前までは変換してくれるのかと思ってた。
いらぬ時間をとらせてすまねぇ。
んで(w)、また懲りずに考えてみたんだが、nkf使うんだったら
find work/ -type f -exec sh -c 'FN="`dirname \"{}\"`"/"`basename \"{}\" | nkf -w`"; [ -f "$FN" ] || mv -v "`echo \"{}\"`" "$FN"' \;
とかいかが?
ディレクトリ含まれてないんだけど、含むと末端からやらないといけないからシェルスクリプトでやるのは面倒くさそうだなァ、と思って逃げたw
■ このスレッドは過去ログ倉庫に格納されています