【Python】計算文本相似度

import jieba
import numpy as np
import re

def get_word_vector(s1,s2):
    """
    :param s1: 句子1
    :param s2: 句子2
    :return: 返回句子的餘弦相似度
    """
    # 分詞
    cut1 = jieba.cut(s1)
    cut2 = jieba.cut(s2)
    list_word1 = (','.join(cut1)).split(',')
    list_word2 = (','.join(cut2)).split(',')

    # 列出所有的詞,取並集
    key_word = list(set(list_word1 + list_word2))
    # 給定形狀和類型的用0填充的矩陣存儲向量
    word_vector1 = np.zeros(len(key_word))
    word_vector2 = np.zeros(len(key_word))

    # 計算詞頻
    # 依次確定向量的每個位置的值
    for i in range(len(key_word)):
        # 遍歷key_word中每個詞在句子中的出現次數
        for j in range(len(list_word1)):
            if key_word[i] == list_word1[j]:
                word_vector1[i] += 1
        for k in range(len(list_word2)):
            if key_word[i] == list_word2[k]:
                word_vector2[i] += 1

    # 輸出向量
    return word_vector1, word_vector2


def cos_dist(vec1,vec2):
    """
    :param vec1: 向量1
    :param vec2: 向量2
    :return: 返回兩個向量的餘弦相似度
    """
    dist1=float(np.dot(vec1,vec2)/(np.linalg.norm(vec1)*np.linalg.norm(vec2)))
    return dist1
發佈了192 篇原創文章 · 獲贊 362 · 訪問量 41萬+
發表評論
所有評論
還沒有人評論,想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.
相關文章