HTML収集
■ このスレッドは過去ログ倉庫に格納されています
0001名無しさん
NGNGWWWサーバ数 70000
HTMLファイル数 2000万〜3000万
HTMLファイル全体のサイズ 200GB
だって。サイズは意外と少ないですねー。
0002うに
NGNG画像ファイルとかは含まれていないからだと思う。
ちなみに、どこの統計ですか?
00031
NGNGWWW上のテキストデータの収集を支援する
大容量公開キャッシュサーバの設計と実装@`
日本ソフトウエア科学会 第2回インターネットテクノロジー
ワークショップ(WIT'99)
ですー
0004名無しさん
NGNG10GB以上ある・・・ということは残り69999のサーバが190GBってことか。
ま、この手の統計は全然信用できないから。
0005Five
NGNGカウントしているんでしょうね。例えば C|net や日経 Biztech は
コンテンツはデータベースの中に入れておいて、読み出し要求に応じて
HTML 化して出していると聞いています。あ、2ch もそうか。
完全に静的な HTML 文書だけ、となると意外に少ないのかもしれませんね。
一定規模を超えると自動化やデータベース化を考えてしまいますし。
# http://linux.or.jp/ とかは異常に多そうですけど。(^^;
■ このスレッドは過去ログ倉庫に格納されています