搜狐算法
㈠ 搜狐邮件的50,000KB是多大换算成M是50M吗
你好!
1M=1024KB
50,000KB约为48M
仅代表个人观点,不喜勿喷,谢谢。
㈡ Sohu搜索引擎有什么特点
搜狗
目录·搜狗介绍
·产品优势
·主要产品
·桌面工具
·其他产品
搜狗介绍
搜狗是搜狐公司于2004年8月3日推出的全球首个第三代互动式中文搜索引擎,域名为www.sogou.com。搜狗以搜索技术为核心,致力于中文互联网信息的深度挖掘,帮助中国上亿网民加快信息获取速度,为用户创造价值。
搜狗的产品线包括了网页应用和桌面应用两大部分。网页应用以网页搜索为核心,在音乐、图片、新闻、地图领域提供垂直搜索服务,通过说吧建立用户间的搜索型社区;桌面应用则旨在提升用户的使用体验:搜狗工具条帮助用户快速启动搜索,拼音输入法帮助用户更快速地输入,PXP加速引擎帮助用户更流畅地享受在线音视频直播、点播服务。
搜狗网页搜索作为搜狗最核心的产品,经过两年半持续不断地优化改进,于公元2007年1月1日正式推出3.0版本。全面升级的搜狗网页搜索3.0凭借自主研发的服务器集群并行抓取技术,成为全球首个中文网页收录量达到100亿的搜索引擎;加上每天5亿网页的更新速度、独一无二的搜狗网页评级体系,确保了搜狗网页搜索在海量、及时、精准三大基本指标上的全面领先。
搜狗的其他搜索产品也各有特色。音乐搜索小于2%的死链率,图片搜索独特的组图浏览功能,新闻搜索及时反映互联网热点事件的看热闹首页,地图搜索的全国无缝漫游功能,使得搜狗的搜索产品线极大地满足了用户的需求,体现了搜狗强大的研发能力。
搜狗在产品研发的过程中追求技术创新。尤其值得一提的是,搜狗以一种人工智能的新算法,分析和理解用户可能的查询意图,对不同的搜索结果进行分类,对相同的搜索结果进行聚类,在用户查询和搜索引擎返回结果的人机交互过程中,引导用户更快速准确定位自己所关注的内容。该技术全面应用到了搜狗网页搜索、音乐搜索、图片搜索、新闻搜索、地图搜索等服务中,帮助用户快速找到所需的搜索结果。这一技术也使得搜狗的问世标志了全球首个第三代互动式中文搜索引擎诞生,是搜索技术发展史上的重要里程碑。
基于搜索技术,搜狗还推出了若干桌面应用产品。搜狗工具条是用户快速执行搜索的入口,同时集成了RSS订阅、文件下载加速、广告拦截、网页评级显示等丰富的功能。拼音输入法利用先进的搜索引擎技术,通过对海量互联网页面的统计和对互联网上新词热词的分析,使得首选词准确率(即候选的第一个词就是要输入的词的比例)领先于其他输入法。PXP加速引擎是一套基于PXP技术的互联网音视频直播/点播解决方案,能够支持内容和服务提供方以很少的带宽同时为上万用户提供流畅的视频服务。
设想一个用户在搜狗的使用体验:通过拼音输入法,大幅提升了输入速度;通过网址导航和工具条,直达目标网站或快速启动搜索;通过网页搜索,从百亿中文网页中找到最相关的信息;通过音乐搜索、图片搜索、新闻搜索、地图搜索等专项搜索,满足特定的查找需求;通过说吧平台,和天南海北的用户交流信息;通过PXP加速引擎,更快地下载文件,更流畅地享受在线音视频直播、点播服务。可见,搜狗的全线产品,针对用户访问互联网过程中信息获取不畅的情况,在多个环节提供服务,把新快全准的优质信息提供给用户,提升了用户访问互联网的体验。
产品优势
竞价服务四张王牌:
矩阵支持,广泛覆盖
搜狗得到搜狐门户矩阵支持,通过搜狗搜索引擎、搜狐网各大频 道页面、搜狐 邮箱、合作媒体及行业网站等多种渠道展示企业推 广信息;
定向投放,针对性强
通过上下文分析技术,将企业信息展示在最合适的页面上,定向 传递给潜在客户。还可按区域投放
免费展示,点击付费
任何企业信息免费在推广平台上展示,只有当客户点击后才开始 收费
自主掌控,性价比高
企业可根据自身需要,自主掌控推广内容和资金投入,享受搜狗 提供的最低竞价起价与优质服务
主要产品
1、网页搜索
【搜狗网页搜索3.0】
● 全球首个百亿规模中文搜索引擎,收录100亿网页,再创全球中文网页收录量新高。
一直致力于后台技术研发和数据积累的搜狗,只用了两年时间,网页收录量就飙升至100亿!2007年1月1日震撼上线的搜狗网页搜索3.0将能够成功支持100亿网页的查询,成为全球首个网页收录量达到100亿的中文搜索引擎。
搜索引擎收录网页数据量的大小,一定程度上反映了研发团队的技术实力,搜狗网页搜索3.0凭借领先的技术实力,向中文互联网用户提供最全面的互联网信息服务。
●每日网页更新达5亿,用户可直接通过网页搜索而非新闻搜索,获得最新新闻资讯。
在抓取速度上,搜狗通过智能分析技术,对于不同网站、网页采取了差异化的抓取策略,充分地利用了带宽资源来抓取高时效性信息,确保互联网上的最新资讯能够在第一时间被用户检索到。
在网页搜索3.0平台上,每天搜狗的服务器集群并行更新超过五亿的网页。在强大的更新能力下,用户不必再通过新闻搜索,就能获得最新的资讯。此外,搜狗网页搜索3.0提供“按时间排序”功能,能够帮助用户更快地找到想要的信息。
●在导航型和信息型的两种查询结果中,分别以94%和67%的准确度领先业界。
搜狗网页搜索3.0搜索结果排名采用业界广泛认可的首个中文网页评级体系——搜狗网页评级体系(Sogou Rank),该评级体系依托搜狗百亿中文网页的储备,分析最全的中文互联网链接库,确保评级的客观公正。搜狗网页搜索3.0由于有了这个网页评级体系的保证,搜狗的搜索结果能够做到更加精准。
经过人工对于随机选取的上千个查询词进行测试,搜狗在导航型和信息事务型查询的表现,分别达到了94%和67%的准确度,处于业内领先水平。
2、网页搜索特色
网页搜索有非常多且实用的特色功能
●搜索功能
分类提示、网页评级、站内查询、网页快照、相关搜索、拼音查询、智能纠错、高级搜索、 文档搜索
●实用工具
天气预报、手机号码、单词翻译 、 生字快认、 成语查询、 计算器 、 IP地址
●右侧提示
搜索音乐、 搜索地图 、 股票查询 、 邮编查询 、区号查询 、 楼盘查询、 游戏查询 、 热书荐读、博客推荐
3、音乐搜索
搜索歌曲、歌词、铃声、原创,流行音乐排行榜
4、图片搜索
搜索互联网缤纷世界,美女帅哥图片看不尽!
5、新闻搜索
即时采集近2000家新闻源,每分钟更新
6、地图搜索
提供中国最好的网上地图服务,覆盖200多个城市
7、说吧
网民畅所欲言的平台,在这里想说就说
8、网址导航
搜狗为您精选的优秀网站大全,方便实用
9、博客搜索
搜集十八万个博客站点,每日更新
10、视频搜索
网罗海量精彩视频,提供完美观看体验!
11、知识搜索
利用搜索技术提取互联网的“知识”
12、搜狗金榜
搜狗金榜 是一种针对特定关键词,根据不同位置和时间长短收取相应固定费用的网络推广方式。固定排名出现在搜狐和搜狗搜索结果第一页右侧。广大网民不仅可通过搜狗搜索引擎看到企业信息,还可通过搜狐首页的“行业资讯”直接进入搜狗搜索结果页,从而为企业带来更多商机!
固定排名1-4位,价钱不同,位置固定。5-8位价钱相同,按天轮流展示,即每个企业的信息至少有1/4的概率在首页首屏展现,保证推广效果.例如:25号5-8位的客户分别是A、B、C、D,26号5-8位的客户分别是D、A、B、C,依次类推,循环展示。
桌面工具
1、搜狗工具条
让搜索更加方便的搜索栏,可听音乐、看图片,提升下载速度3-5倍,可断点续传。
【全能搜索】
集成了搜狗、网络、Google等数十种最热门的搜索引擎,使您的搜索更加自由。
【高速下载】
通过多线程、多镜像、P2P等加速技术,使IE浏览器的下载速度提高3-5倍;不必再安装复杂的下载工具,无须额外配置,使用方法与在IE浏览器中下载完全一致;同时您还可以方便地管理正在下载、暂停下载和已经完成的下载任务。
【我的订阅】
支持RSS协议,使您准确、全面、及时地获取新闻内容。
【 广告拦截】
摆脱网站上弹出广告窗口的干扰。
【扩展功能】
特有插件扩展功能,使您可以自由安装“校友录”、“股市行情”、“闪电邮件”、“音乐盒”、“沸点网络电视”等扩展功能。
【换肤功能】
随时切换皮肤,使您的搜狗工具条迅速变换不同的外观和不同的功能组合。
2、搜狗拼音输入法
中文输入法的革命!绝不同于传统的全新搜狗输入法,于搜索引擎技术,功能强大,特别适合网络使用。
【超强互联网词库,无所不包】
利用搜索引擎技术,根据搜索词生成的输入法互联网词库,能够覆盖所有类别的流行词汇。无论是最新的歌手、电视剧、电影名、游戏名,还是球星、软件名、动漫、歌曲、电视节目,全部一网打尽。
【先进的智能组词算法,首选词准确率第一】
最新的智能组词算法应用了领先的搜索引擎技术,分析搜索引擎语料库的语言模型,使搜狗输入法的首选词准确率在所有输入法中居第一。
【功能强大,兼容多种输入习惯】
提供全面的按键设置和外观选择,尽可能适应各种常见输入法的输入习惯,使智能ABC、微软拼音、拼音加加、紫光拼音等输入法的用户都可以轻松上手。
【易用性佳,高级功能丰富】
通过对输入细节的观察,我们特别设计了许多体贴的功能,ign→ing拼音纠错、网址输入模式、词语联想、自动在线升级词库等为你创造更为流畅的输入体验!
其他产品
1、搜狗实验室
创意产品、原型演示、资料下载、学术论文 搜狗指数,网络搜索次数排行,展示当前最新热点及关注排行!
搜狗实验室(Sogou Labs)是搜狗搜索核心研发团队对外交流的窗口,包含创意产品、原型演示、资料下载、学术论文四个栏目。我们期望通过这个平台,展现搜狗研发团队强大的研发、创新能力;推动学术界和产业界的交互;了解用户对新产品的需求。我们的目标:为中文网民的互联网生活提供更加全面、更加优质的服务。
2、分类目录
搜狐网站的分类网站资源,人工整理50万优选网站 商机搜索。索您所需商业信息,掌握比竞争对手更多的销售机会 。
3、搜狗指数
网络搜索次数排行,展示当前最新热点及关注排行!
4、商机搜索
搜索您所需商业信息,掌握比竞争对手更多的销售机会
㈢ 搜索引擎的查询原理是怎么样的
在浩如烟海的Internet上,特别是其上的Web(World Wide Web万维网)上,不会搜索,就不会上网。网虫朋友们,你了解搜索引擎吗?它们是怎么工作的?你都使用哪些搜索引擎?今天我就和大家聊聊搜索引擎的话题。
一、搜索引擎的分类
获得网站网页资料,能够建立数据库并提供查询的系统,我们都可以把它叫做搜索引擎。按照工作原理的不同,可以把它们分为两个基本类别:全文搜索引擎(FullText Search Engine)和分类目录Directory)。
全文搜索引擎的数据库是依靠一个叫“网络机器人(Spider)”或叫“网络蜘蛛(crawlers)”的软件,通过网络上的各种链接自动获取大量网页信息内容,并按以定的规则分析整理形成的。Google、网络都是比较典型的全文搜索引擎系统。
分类目录则是通过人工的方式收集整理网站资料形成数据库的,比如雅虎中国以及国内的搜狐、新浪、网易分类目录。另外,在网上的一些导航站点,也可以归属为原始的分类目录,比如“网址之家”(http://www.hao123.com/)。
全文搜索引擎和分类目录在使用上各有长短。全文搜索引擎因为依靠软件进行,所以数据库的容量非常庞大,但是,它的查询结果往往不够准确;分类目录依靠人工收集和整理网站,能够提供更为准确的查询结果,但收集的内容却非常有限。为了取长补短,现在的很多搜索引擎,都同时提供这两类查询,一般对全文搜索引擎的查询称为搜索“所有网站”或“全部网站”,比如Google的全文搜索(http://www.google.com/intl/zh-CN/);把对分类目录的查询称为搜索“分类目录”或搜索“分类网站”,比如新浪搜索(http://dir.sina.com.cn/)和雅虎中国搜索(http://cn.search.yahoo.com/dirsrch/)。
在网上,对这两类搜索引擎进行整合,还产生了其它的搜索服务,在这里,我们权且也把它们称作搜索引擎,主要有这两类:
⒈元搜索引擎(META Search Engine)。这类搜索引擎一般都没有自己网络机器人及数据库,它们的搜索结果是通过调用、控制和优化其它多个独立搜索引擎的搜索结果并以统一的格式在同一界面集中显示。元搜索引擎虽没有“网络机器人”或“网络蜘蛛”,也无独立的索引数据库,但在检索请求提交、检索接口代理和检索结果显示等方面,均有自己研发的特色元搜索技术。比如“metaFisher元搜索引擎”(http://www.hsfz.net/fish/),它就调用和整合了Google、Yahoo、AlltheWeb、网络和OpenFind等多家搜索引擎的数据。
⒉集成搜索引擎(All-in-One Search Page)。集成搜索引擎是通过网络技术,在一个网页上链接很多个独立搜索引擎,查询时,点选或指定搜索引擎,一次输入,多个搜索引擎同时查询,搜索结果由各搜索引擎分别以不同页面显示,比如“网际瑞士军刀”(http://free.okey.net/%7Efree/search1.htm)。
二、搜索引擎的工作原理
全文搜索引擎的“网络机器人”或“网络蜘蛛”是一种网络上的软件,它遍历Web空间,能够扫描一定IP地址范围内的网站,并沿着网络上的链接从一个网页到另一个网页,从一个网站到另一个网站采集网页资料。它为保证采集的资料最新,还会回访已抓取过的网页。网络机器人或网络蜘蛛采集的网页,还要有其它程序进行分析,根据一定的相关度算法进行大量的计算建立网页索引,才能添加到索引数据库中。我们平时看到的全文搜索引擎,实际上只是一个搜索引擎系统的检索界面,当你输入关键词进行查询时,搜索引擎会从庞大的数据库中找到符合该关键词的所有相关网页的索引,并按一定的排名规则呈现给我们。不同的搜索引擎,网页索引数据库不同,排名规则也不尽相同,所以,当我们以同一关键词用不同的搜索引擎查询时,搜索结果也就不尽相同。
和全文搜索引擎一样,分类目录的整个工作过程也同样分为收集信息、分析信息和查询信息三部分,只不过分类目录的收集、分析信息两部分主要依靠人工完成。分类目录一般都有专门的编辑人员,负责收集网站的信息。随着收录站点的增多,现在一般都是由站点管理者递交自己的网站信息给分类目录,然后由分类目录的编辑人员审核递交的网站,以决定是否收录该站点。如果该站点审核通过,分类目录的编辑人员还需要分析该站点的内容,并将该站点放在相应的类别和目录中。所有这些收录的站点同样被存放在一个“索引数据库”中。用户在查询信息时,可以选择按照关键词搜索,也可按分类目录逐层查找。如以关键词搜索,返回的结果跟全文搜索引擎一样,也是根据信息关联程度排列网站。需要注意的是,分类目录的关键词查询只能在网站的名称、网址、简介等内容中进行,它的查询结果也只是被收录网站首页的URL地址,而不是具体的页面。分类目录就像一个电话号码薄一样,按照各个网站的性质,把其网址分门别类排在一起,大类下面套着小类,一直到各个网站的详细地址,一般还会提供各个网站的内容简介,用户不使用关键词也可进行查询,只要找到相关目录,就完全可以找到相关的网站(注意:是相关的网站,而不是这个网站上某个网页的内容,某一目录中网站的排名一般是按照标题字母的先后顺序或者收录的时间顺序决定的)。
一个好的搜索引擎,不仅数据库容量要大,更新频率、检索速度要快,支持对多语言的搜索,而且随着数据库容量的不断膨胀,还要能从庞大的资料库中精确地找到正确的资料。
⒈提高搜索引擎对用户检索提问的理解。为了提高搜索引擎对用户检索提问的理解,就必须有一个好的检索提问语言。为了克服关键词检索和目录查询的缺点,现在已经出现了自然语言智能答询。用户可以输入简单的疑问句,比如“如何能杀死计算机中的病毒”,搜索引擎在对提问进行结构和内容的分析之后,或直接给出提问的答案,或引导用户从几个可选择的问题中进行再选择。自然语言的优势在于,一是使网络交流更加人性化,二是使查询变得更加方便、直接、有效。就以上面的例子来讲,如果用关键词查询,多半人会用“病毒”这个词来检索,结果中必然会包括各类病毒的介绍,病毒是怎样产生的等等许多无用信息,而用“如何能杀死计算机中的病毒”检索,搜索引擎会将怎样杀死病毒的信息提供给用户,提高了检索效率。
⒉垂直主题搜索引擎有着极大的发展空间。网上的信息浩如烟海,网络资源以惊人的速度增长,一个搜索引擎很难收集全所有主题的网络信息,即使信息主题收集得比较全面,由于主题范围太宽,很难将各主题都做得精确而又专业,使得检索结果垃圾太多。这样以来,垂直主题的搜索引擎以其高度的目标化和专业化在各类搜索引擎中占据了一席之地。目前,一些主要的搜索引擎,都提供了新闻、Mp3、图片、Flash等的搜索,加强了检索的针对性。
⒊元搜索引擎,能够提供全面且较为准确的查询结果。现在的许多搜索引擎,其收集信息的范围、索引方法、排名规则等都各不相同,每个搜索引擎平均只能涉及到整个Web资源的30-50%,这样导致同一个搜索请求在不同搜索引擎中获得的查询结果的重复率不足34%,而每一个搜索引擎的查准率不到45%。元搜索引擎(META Search Engine)是将用户提交的检索请求发送到多个独立的搜索引擎上去搜索,并将检索结果集中统一处理,以统一的格式提供给用户,因此有搜索引擎之上的搜索引擎之称。它的主要精力放在提高搜索速度、智能化处理搜索结果、个性化搜索功能的设置和用户检索界面的友好性上,查全率和查准率都比较高。
四、主要的搜索引擎介绍
这里介绍的是在国内外影响比较大的主要的一些搜索引擎和分类目录站点,由于现在的站点一般都同时提供全文搜索和分类目录两种服务,所以我们按照其自有的技术进行分类和介绍。
一主要的全文搜索引擎
⒈Google(http://www.google.com/)。Google成立于1997年,几年间迅速发展成为世界范围内规模最大的搜索引擎。Google数据库现存有42.8亿个Web文件,每天处理的搜索请求已达2亿次,而且这一数字还在不断增长。Google借用Dmoz(http://dmoz.org/)的分类目录提供“网页目录”查询(http://www.google.com/dirhp?hl=zh-CN&tab=wd&ie=UTF-8&oe=UTF-8&q=),但默认网站排列顺序并非按照字母顺序,而是根据网站PageRank的分值高低排列。
⒉网络(http://www..com/)。网络是国内最早的商业化(早期为其它门户网站提供搜索服务,现在的竞价排名更是日进斗金)全文搜索引擎,拥有自己的网络机器人和索引数据库,专注于中文的搜索引擎市场,除有网页搜索外,网络还有新闻、MP3、图片等搜索,并在2003年底推出“贴吧”、按地域搜索等功能。
⒊中国搜索(http://www.huicong.com/)。中国搜索的前身是慧聪搜索,原慧聪搜索在联合中国网等30多家知名网站的基础上,2002年9月25日,正式组建了中国搜索联盟,经过一年多的发展,联盟成员就已达630多家,成为中国互联网一支重要的力量。由于发展迅速,慧聪集团借上市之机,将慧聪搜索更名为中国搜索,全力发展其在搜索引擎方面的业务,以打造中文搜索领域的全新品牌。
二主要分类目录
⒈雅虎中国分类目录(http://cn.yahoo.com/)。雅虎中国的分类目录是最早的分类目录,现有14个主类目,包括“商业与经济”、“艺术与人文”等,可以逐层进入进行检索,也可以利用关键词对“分类网站”进行搜索(http://m6.search.cnb.yahoo.com/dirsrch/)。此外,雅虎中国也可以对“所有网站”进行关键词搜索(http://cn.search.yahoo.com/websrch/),早期,他的搜索结果使用Google的数据,2004年2月正式推出自己的全文搜索引擎,并结束了与Google的合作。
⒉新浪分类目录(http://dir.sina.com.cn/)。新浪的分类目录目前共有18个大类目,用户可按目录逐级向下浏览,直到找到所需网站。就好像用户到图书馆找书一样,按照类别大小,层层查找,最终找到需要的网站或内容。通过和其它全文搜索引擎的合作,现在,也可以使用关键词对新浪的“分类网站”或“全部网站”进行搜索。
⒊搜狐分类目录(http://dir.sohu.com/)。搜狐分类目录把网站作为收录对象,具体的方法就是将每个网站首页的URL地址提供给搜索用户,并且将网站的题名和整个网站的内容简单描述一下,但是并不揭示网站中每个网页的信息内容。除此之外,也可以使用关键词对搜狐的“分类目录”或所有网站进行搜索。
⒋网易分类目录(http://search.163.com/)。网易的分类目录采用“开放式目录”管理方式,在功能齐全的分布式编辑和管理系统的支持下,现有5000多位各界专业人士参与可浏览分类目录的编辑工作,极大地适应了互联网信息爆炸式增长的趋势。在加强与其它搜索引擎合作的基础上,新版搜索引擎支持使用关键词对所有网站进行检索。
实际上,搜索引擎的众多技术都是高度保密的,以是仅仅是笔者的一些愚见,不足之处,还请众大虾批评指正。
㈣ 描述对于域名www.sohu.com的解析过程
IP地址和域名:
Internet采用IP地址标识主机,每个主机有唯一IP地址,当客户端地址栏输入域名www.sohu.com后,首先应把域名解析为IP地址,第二步再由此IP地址找到目的主机
域名服务器:
Internet上有一类专门实现域名-IP地址转换的服务器,即域名服务器(DNS服务器)域名服务器本身被组织成层次结构,这个层次结构的域名服务器的逻辑结构是域名解析的基础,每个域名服务器记录了一组(按域名的层次结构)域名-IP地址的对照表。
域名解析:
总的来说,域名解析采用自顶向下的算法,从根服务器开始直到叶服务器映射。域名解析有两种方式。第一种称为递归解析(Recursive Resolution),要求域名服务器系统一次性完成全部名字-地址变换。第二种称为反复解析(Iterative Resolution),每次请求一个服务器,不行再请求别的服务器。为提高域名解析的效率解析从本地域名服务器开始(您的电脑TCP/IP属性中就可以找到"首选域名服务器")