复制网页是怎样形成的？

dn001 2008-02-15 10:42:11

复制网页(或者叫重复内容网页)指的是两个或多个网页内容相同，或非常相似。

一般来说，搜索引擎不喜欢复制内容网页，他们会尽量判断哪一个是原始版本，然后把其他的复制网页忽略不计。

有两点值得注意：

1）复制网页的判断并没有一个比例。比如说一个网页上有60％或80％的内容和其他网页相同，就被列为复制网页，如果真有一个比例那就简单多了。

2）复制网页并不会带来惩罚。搜索引擎会丢掉其他的复制网页，但不会惩罚搜索引擎认为的原始出处。

不过这就有可能对真正原始出处产生惩罚。比如搜索引擎判断错误，把原始出处当成复制的，而把复制的当成原始出处。

复制内容网页的出现一般有这些可能性：

1）网址规范化问题所产生的。

2）代理商和零售商的网站经常从产品生产商的网站上抄下产品信息。这倒没什么不对，一般产品生产商也都同意，但是绝大部分代理商，零售商，批发商都会直接copy，而不做改动。所以这些电子商务网站上充斥着大量复制内容网页。

3）打印版本。很多网站提供更适于打印的版本，如果没有用robots.txt文件，那么这些打印版本网页就可能会变成复制网页。

4）网页内容由RSS生成。有很多网站，尤其是新闻类网站，都是用其他网站的RSS feed来生成网站内容的，这些内容在原始出处和很多其他网站上都已经出现了。

5）电子商务网站使用Session ID。搜索引擎蜘蛛在不同时间访问网页的时候，被给了不同的Session ID，但实际上网页内容是一样的。不过由于Session ID的参数不同，就被当成了不同的网页。

7）文章抄袭转载等。有的时候是其他人抄袭了你的网站内容，有的时候是善意的转载，有的时候是作者自愿的向不同的网站发送文章，这些都有可能造成复制内容网页。

8）镜象网站。镜象网站曾经很流行，当一个网站太忙太慢的时候，用户可以通过替代镜象来看内容或下载，这也有造成复制内容网页的风险。

9）产品或服务类型之间区别比较小。比如有的网站把自己的产品或服务按地区进行分类，但实际上提供给每个地区的产品或服务都是一样的。在这些按地区分类的网页上，只是把地名改了改，其他内容全都一样。