传统词嵌入方法的千层套路

news2024/9/21 17:49:56

诸神缄默不语-个人CSDN博文目录

在自然语言处理(NLP)领域,词嵌入是一种将词语转换为数值形式的方法,使计算机能够理解和处理语言数据。
词嵌入word embedding也叫文本向量化/文本表征。
本文将介绍几种流行的传统词嵌入方法。

文章目录

  • 0. 独热编码
  • 1. 词袋模型
  • 2. TF-IDF
  • 3. word2vec
    • 1. skip-gram
    • 2. CBOW
  • 4. LSA
  • 5. GloVe
  • 6. CoVe

0. 独热编码

one-hot encoding

将每个词表示为一维向量
在这里插入图片描述

1. 词袋模型

bag of word (BoW)

词袋模型是最简单的文本表示法之一。它将文本转换为一个长向量,这个向量的每一个元素代表词汇表中的一个词,并记录该词在文本中出现的次数。

在这里插入图片描述

  • 优点:简单易懂,易于实现。
  • 缺点:忽略了词语的顺序和上下文信息,无法捕捉词与词之间的关系。

sklearn的实现:

from sklearn.feature_extraction.text import CountVectorizer

corpus  #由字符串组成的列表
vector = CountVectorizer().fit(corpus)
train_vector = vector.transform(corpus)

2. TF-IDF

term frequency-inverse document frequency

TF-IDF是一种用于信息检索和文本挖掘的常用加权技术。它评估一个词对于一个文档集或一个语料库中的其中一份文档的重要程度。

TF (Term Frequency)中文含义是词频,IDF (Inverse Document Frequency)中文含义是逆文本频率指数。

TF统计的是词语在特定文档中出现的频率,而IDF统计的是词语在其他文章中出现的频率,其处理基本逻辑是词语的重要性随着其在特定文档中出现的次数呈现递增趋势,但同时会随着其在语料库中其他文档中出现的频率递减下降(考虑到有些常用词在所有文档里面都很常见)。
数学表达式如下:
TF-IDF ( w , d ) = TF ( w , d ) × IDF ( w ) \text{TF-IDF}(w,d)=\text{TF}(w,d)\times \text{IDF}(w) TF-IDF(w,d)=TF(w,d)×IDF(w)

  • 优点:能够减少常见词的影响,突出重要词汇。
  • 缺点:与BoW一样,忽略了词序和上下文信息。

sklearn的实现:

from sklearn.feature_extraction.text import TfidfVectorizer

tfidf=TfidfVectorizer(max_features=500)
corpus  #由字符串组成的列表
sp_tfidf=tfidf.fit_transform(corpus)  #返回稀疏矩阵,每一行是语料中对应文档的表示向量

3. word2vec

Word2Vec是一种预测模型,用于产生词嵌入。它有两种结构:连续词袋(CBOW)和跳字模型(Skip-Gram)。

  • 优点:能够捕捉一定程度的词序和上下文信息。
  • 缺点:对于每个词仅有一个嵌入表示,忽略了多义性。

原始论文:
Distributed Representations of Sentences and Documents:提出word2vec框架
Efficient Estimation of Word Representations in Vector Space:介绍训练trick:hierarchical softmax 和 negative sampling

1. skip-gram

用一个词语作为输入,来预测它周围的上下文

训练思路:用独热编码表示词语。输入这个词语的独热编码,转换为隐藏层编码,输出上下文的独热编码
在这里插入图片描述

2. CBOW

Continues Bag of Words

拿一个词语的上下文作为输入,来预测这个词语本身

在这里插入图片描述

4. LSA

LSA使用奇异值分解(SVD)技术来减少特征空间的维数,并捕捉词之间的隐含关系。

  • 优点:能够改善稀疏性问题,捕捉词义关系。
  • 缺点:计算复杂,难以处理非常大的语料库。

5. GloVe

GloVe结合了矩阵分解和局部上下文窗口的优点。它通过词与词共现的概率信息来生成词向量。

  • 优点:在全局语料统计和局部上下文信息之间找到了平衡。
  • 缺点:需要大量的语料数据来有效训练。

6. CoVe

原论文:(2017) Learned in Translation: Contextualized Word Vectors

早期LM的感觉

CoVe是一种基于上下文的词嵌入方法,它利用序列到序列的模型从大量翻译数据中学习词向量。

  • 优点:能够捕捉上下文中的词义变化,处理多义性问题。
  • 缺点:模型较为复杂,需要大量的训练数据和计算资源。

在这里插入图片描述
Cove: 从Word2Vec/Glove的启示 - 知乎


以上就是几种传统的词嵌入方法的简介。每种方法都有其独特之处,选择适合的词嵌入技术可以极大地提升自然语言处理任务的性能。希望这篇文章能帮助你更好地理解不同的词嵌入方法,为你的NLP项目选择合适的技术。

参考资料:

  1. 文本向量化的六种常见模式
  2. 还没看完:
    1. [NLP] 秒懂词向量Word2vec的本质 - 知乎(整理到“我举个例子,假设全世界所有的词语总共有 V 个,这 V 个词语有自己的先后顺序,假设『吴彦”这一行)
    2. 全面理解word2vec
    3. word2vec简介
    4. 词向量学习算法 Glove - 简书
    5. A Neural Probabilistic Language Model
    6. NLP方向Word2vec算法面试题6道|含解析
    7. (2011 PMLR) Deep Learning for Efficient Discriminative Parsing
    8. 深度学习word2vec笔记之基础篇-CSDN博客
    9. word2vec Explained: deriving Mikolov et al.'s negative-sampling word-embedding method
    10. word2vec Parameter Learning Explained
    11. word2vec 相比之前的 Word Embedding 方法好在什么地方? - 知乎
    12. (2016 国科大博士论文) 基于神经网络的词和文档语义向量表示方法研究
    13. On word embeddings - Part 2: Approximating the Softmax

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.coloradmin.cn/o/1230918.html

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈,一经查实,立即删除!

相关文章

SpringBoot2—运维实用篇

目录 打包与运行 • 程序打包与运行(Windows版) • 程序运行(Linux版) 配置高级 • 临时属性设置 • 配置文件分类 • 自定义配置文件 多环境开发 多环境开发(yaml单一文件版) 多环境开发&am…

『亚马逊云科技产品测评』活动征文|通过lightsail一键搭建Drupal VS 手动部署

『亚马逊云科技产品测评』活动征文|通过lightsail一键搭建Drupal 提示:授权声明:本篇文章授权活动官方亚马逊云科技文章转发、改写权,包括不限于在 Developer Centre, 知乎,自媒体平台,第三方开发者媒体等亚…

Debian系列的Linux发行版上部署wvp

Debian系列的Linux发行版上部署wvp 环境搭建1.Debian系列的Linux发行版上安装nginx2.安装mysql设置mysql密码修改权限sudo mysql ERROR 1045 (28000): Access denied for user root@localhost (using password: NO)配置相关navicat 连接不上 报错 10061navicat 连接报错 1130 -…

【考研数学】正交变换后如果不是标准型怎么办?| 关于二次型标准化的一些思考

文章目录 引言一、回顾二次型的定义是什么?什么叫标准二次型?怎么化为标准型? 二、思考写在最后 引言 前阵子做了下 20 年真题,问题大大的,现在订正到矩阵的第一个大题,是关于二次型正交变换的。和常规不同…

从硬件到软件:揭秘磁盘结构和文件系统组织

📟作者主页:慢热的陕西人 🌴专栏链接:Linux 📣欢迎各位大佬👍点赞🔥关注🚓收藏,🍉留言 本博客主要内容讲解了从磁盘的硬件结构,再到操作系统内部是…

STM32获取最大堆栈空间

参考 stackflow相关讨论 原理 通过参考链接,可知探测Stack的最大深度是先在stack中填充不常用的特定值,然后实时检测这些值哪些发生了变化,变化的表示使用到了这个空间,如果程序完全遍历后,有些值还是没变&#xff…

Linux下安装两个版本python

1 python下载: 官网地址:Download Python | Python.org 第一:点击下载如下图: 第二:找到对应的python版本源码包: 点击右键复制下载地址,如下图 例如我的是:https://www.python.org/…

openGauss学习笔记-128 openGauss 数据库管理-设置透明数据加密(TDE)

文章目录 openGauss学习笔记-128 openGauss 数据库管理-设置透明数据加密(TDE)128.1 概述128.2 前提条件128.3 背景信息128.4 密钥管理机制128.5 表级加密方案128.6 创建加密表128.7 切换加密表加密开关128.8 对加密表进行密钥轮转 openGauss学习笔记-12…

docker更换国内源

docker更换国内源 1、编辑Docker配置文件 在终端中执行以下命令,编辑Docker配置文件: vi /etc/docker/daemon.json2、添加更新源 在打开的配置文件中,添加以下内容: {"registry-mirrors": ["https://hub-mirror…

MAC上修改mysql的密码(每一步都图文解释哦)

当你想要连接本机数据库时,是不是有可能突然忘记了自己的数据库密码? 在此文中,我们来详细解决一下如何去修改自己的数据库密码,并使用Navicat来连接测试 1.停止mysql服务 打开终端,键入命令,将mysql服务先停止掉,…

OpenAI内斗剧情反转!微软力保ChatGPT之父回归?

美东时间11月17日下午,全球最热门的聊天机器人ChatGPT开发商OpenAI宣布了一项重磅管理层调整,Sam Altman将辞去CEO一职,并离开公司董事会。 Altman被踢出的消息除了让业界担心会影响该公司未来发展外,OpenAI另一位共同创办人暨总裁…

百分点科技|怎样做数据运营,才能让数据中台真正用起来?

导读:大多数企业用户已完成数据平台初步建设工作,但数据在业务运营和管理中没有发挥应有价值。数据开发工作繁重,数据质量问题严重,IT、数据和业务协作不畅,诸多问题依然困扰着企业用户的IT部门和数据部门。数据运营成…

Apache POI(Java)

一、Apache POI介绍 Apache POI是Apache组织提供的开源的工具包(jar包)。大多数中小规模的应用程序开发主要依赖于Apache POI(HSSF XSSF)。它支持Excel 库的所有基本功能; 文本的导入和导出是它的主要特点。 我们可以使用 POI 在…

5分钟制作可直接导入GPTs知识库中的自动爬虫

它能从一个或多个网址爬取网站内容,然后生成JSON文件格式。这样爬取的内容可以直接导入到GPTs知识库中,方便你创建自定义知识库的GPTs。比如你有自己的网站或者资料库,但是整理起来太麻烦,就可以使用这个工具。 主要功能&#xf…

算法分析与设计课后练习21

某工业生产部门根据国家计划的安排,拟将某种高效率的5台机器,分别分配给A,B,C三个工厂,各工厂在获得不同数量的这种机器后,可以为国家盈利如下表所示。请找出一种5台机器的分配方式,使得这5台机器盈利最大。 使用动态规划,令dp[i][j]=max(dp[i-1][j-k]+profit[i][k])…

【计算机网络学习之路】UDP socket编程

文章目录 前言一. 网络通信本质端口号TCP与UDP网络字节序 二. socket编程接口socket()和sockaddr结构体 三. 简单echo服务结束语 前言 本系列文章是计算机网络学习的笔记,欢迎大佬们阅读,纠错,分享相关知识。希望可以与你共同进步。 一. 网…

【UE】线框材质

一、方式1 新建一个材质,混合模式设置为“已遮罩”,勾选“双面” 勾选“线框” 然后可以随便给一个自发光颜色,这样最基本的线框材质就完成了 二、方式2 新建一个材质,混合模式设置为“已遮罩”,勾选“双面”&#x…

yolo系列模型训练数据集全流程制作方法(附数据增强代码)

yolo系列的模型在目标检测领域里面受众非常广,也十分流行,但是在使用yolo进行目标检测训练的时候,往往要将VOC格式的数据集转化为yolo专属的数据集,而yolo的训练数据集制作方法呢,最常见的也是有两种,下面我…

AC修炼计划(AtCoder Beginner Contest 328)

传送门: Toyota Programming Contest 2023#7(AtCoder Beginner Contest 328) - AtCoder 本章对于自己的提升:dfs的运用,带权并查集,以及状压dp。 A,B,C题比较简单,直接…

Adult数据集预处理

因为adult数据集没有列名,先设置列名 df pd.read_csv(adult.csv, header None, names [age, workclass, fnlwgt, education, education-num, marital-status, occupation, relationship, race,sex, capital-gain, capital-loss, hours-per-week, native-countr…