CNDEV
...
...
账号
登
登录
先
先随便看看
中国开发网
: 论坛:
程序员情感CBD
: 贴子 293572
李战
·
2006-03-10 03:34:33
·
阅读: 1632
网页爬虫程序加网页结构化提取程序
<空>
相关信息:
技术贴
(66字)
(
ysb_ysb_ysb
[687]
2006-03-10 11:18
)
不能垮下去!
(空) (
ysb_ysb_ysb
[479]
2006-03-10 11:27
)
你又想搞么事?,帮你顶
(空) (
C007
[527]
2006-03-10 11:28
)
网页爬虫程序加网页结构化提取程序
(空) (
李战
[1631]
2006-03-10 11:34
)
恩,先搜寻这方面的资料看看
(空) (
ysb_ysb_ysb
[504]
2006-03-10 11:39
)
那个baidu
(空) (
ysb_ysb_ysb
[551]
2006-03-10 11:43
)
那个baidu是怎么搜寻的阿 ?
(空) (
ysb_ysb_ysb
[575]
2006-03-10 11:43
)
这个爬爬虫还蛮有用的,呵呵
(空) (
ysb_ysb_ysb
[510]
2006-03-10 11:52
)
爬虫程序比较好做,一般有两种:一种是自行解析HTML中的后续链接,爬行速度快,只能解析静态链接;一种是基于浏览器的DOM来解析或获得静态或动态后续链接,爬行缓慢。
(空) (
李战
[843]
2006-03-10 13:11
)
而网页内容提取可能需要根据不同的网址模式来定义提取模式。内容项的定位往往需要先找到特征的标题文字再提取随后的内容。这个比较复杂点
(空) (
李战
[618]
2006-03-10 13:16
)
网站总有默认页吧?用 http 去取那一页。取到后,分析那个页里的链接,把每个链接指向的页面也抓下来。每个页面里又有链接....你想抓多深?
(空) (
pcplayer
[558]
2006-03-10 11:40
)
我只要把这个网站的客户资料抓下来就可以了
(空) (
ysb_ysb_ysb
[480]
2006-03-10 11:44
)
客户资料是以什么形式进行保存的,是连续的HTML页面么?
(空) (
Apache
[513]
2006-03-10 12:18
)
很早以前用delphi写过一个这么样的玩意,专门用来搜索email地址的。CJF好像也干过
(空) (
Water-E
[549]
2006-03-10 12:24
)
欢迎光临本社区,您还没有登录,不能发贴子。请在
这里登录