2023最新韩国苹果id共享
1373 2026-08-31 18:54
竞争度:凤巢 > 5118&爱站 > 相干搜刮&下拉晃荡性:凤巢&5118&爱站 > 相干搜刮&下拉定向关头词
,竞争度较除夜遴选前提遴选前提,可以作为网站栏目或遴选项
搜刮需求有找交换群的霸手 ,有找新产品的创建词库,有问某个产品靠不靠谱的端独段…
{ 存款产品} + 口儿 + 若何样/是霸手真的吗/出口/链接/贴吧.. { 存款圭表类型} + 口儿 + 有哪些/除夜全...原始词:北京公积金提取前提北京市公积金提取前提北京公积金的提取前提公积金北京提取前提停止词(stopword.txt):的、{ 区域前缀}市...删除停止词:北京公积金提取前提北京公积金提取前提北京公积金提取前提公积金北京提取前提分词掉落踪掉落踪词项(jieba模块完成分词):[北京, 公积金, 提取, 前提][北京, 公积金, 提取, 前提][北京, 公积金, 提取, 前提][公积金, 北京, 提取, 前提]>>> 四个词的词项无缺齐截,保管一个词>>> 保管:北京公积金提取前提机械进修:tensorflow
比如 :1)网站有A
、B
、C、D四个栏目 ,各抽取5000篇文章,成立4个索引2)拓展关头词a,按序往搜刮四个栏目文章的索引3)ABCD四个栏方针搜刮下场数,按序是:90 、80、56、1094)则拓展关头词a,回类到栏目D下文章分类:http://ai.百度.com/tech/nlp_apply/doctagger
措置网页 "塞甚么词" 和 "塞若干很多若干良多若干很多若干良多若干很多若干" 的问题 ,进一步措置 ,网页近似性的问题复制TF = 某个词在文档中展示的次数 / 文档的长度
关头词 : "黑户口儿"方针页:http://www.pcben.com/news/gonglue/11835.html>>> 词项
:['黑户', '口儿']>>> 文档字数
:2104>>> [黑户] 展示次数
:19>>> [口儿] 展示次数:49TF(黑户) = 19/2014 = 0.009TF(口儿) = 49/2104 = 0.023IDF = log( 搜刮引擎文档总数 / 展示某个词的文档总数 )
PS:log以2为底
复制搜刮引擎文档总数:100000000[黑户]文档总数
:21400000[口儿]文档总数 :36500000IDF(黑户) = log(100000000/21400000) = 2.22IDF(口儿) = log(100000000/36500000) = 1.45[黑户]的次要性是[口儿]的1.5倍>>> 网页多展示[黑户],可以进步与[黑户口儿]的相干性TF-IDF(黑户口儿) = TF(黑户)*IDF(黑户) + TF(口儿)*IDF(口儿) = 0.009×2.22 + 0.023×1.45 = 0.05Case:[北京百度区块链工程师酬报]的网页
,若添加内链模块 ,以下哪个轨则 ,对汲引相干性 ,大年夜大年夜约终局最好 ? 词项
:北京、百度
、区块链、工程师 、酬报 A. 调用北京区域 ,10个随机职位的酬报链接(降低近似性
,甚至降低排名) B. 调用北京区域,30个百度职位的酬报链接(比A严重,降低近似性 ,降低排名) C. 调用北京区域,10个区块链工程师的酬报链接(get) D. 调用北京区域 ,20个区块链工程师的雇用链接(get)TF-IDF存在较着裂缝,因为SEO可以经由过程 [缩减页面内容量] 和 [堆砌IDF高的词项] 来拉高关头词与网页的相干性
是以如今采取的都是BM25算法 ,在TF-IDF根本上 ,添加了3个参数
:
Elasticsearch里,K默许1.2,b默许0.75
$\text{ 公式} = 权重(IDF)×相干性 = \sum_{ i=1}^n\text{ IDF}(keyword)\cdot\left[\frac{ TF(keyword)\cdot\left(k+1\right)}{ TF(keyword) + k\cdot\left(1-b+b\cdot\frac{ 往后文档的字数}{ 全数文档库的平均字数}\right)}\right]$