Word embedding
Word Embedding
単語をベクトルとして表現する手法
単語間の意味的な関係を数値空間上で捉えるために使用される
https://atmarkit.itmedia.co.jp/ait/articles/2401/18/news023.html
GPT-4.icon
なぜWord Embeddingが必要か?
従来の単語表現(例: One-Hot Encoding)では、以下の課題がありました:
1. 次元の爆発:
語彙数が増えるとベクトルの次元が膨大になり、計算コストが高くなる。
例えば、10,000語の語彙なら10,000次元のベクトルが必要。
2. 意味的な関係を表現できない:
One-Hot Encodingでは、単語間の類似性や関係性が反映されない。
例: "king" と "queen" の類似性を計算することができない。
Word Embeddingの仕組み
1. 埋め込みの生成
単語を低次元の連続値ベクトルに変換するために、Word Embeddingモデルは文脈情報を学習します。
主なアプローチは以下の通りです:
Window-Based Context:
単語とその周辺(コンテキスト)の単語を利用して関係を学習します。
例: 「The cat sits on the mat」の中で、cat のコンテキストは「The」「sits」など。
教師なし学習:
テキストデータのみを使って、単語間の関連性を学習します。
単語ベクトルを直接的にラベル付けするのではなく、周辺単語を予測する形式で学習。
2. 学習手法
主なWord Embeddingのアルゴリズム:
Word2Vec
GloVe
FastText
ELMo
Transformer-Based Models(BERT, GPTなど)
Word Embeddingの特徴
1. 次元圧縮:
高次元(語彙サイズ)のベクトルを低次元(通常100〜300次元)に圧縮。
2. 意味的類似性:
単語間の意味的な類似性がベクトル間の距離や角度で表現される。
例: コサイン類似度を用いて「apple」と「orange」の関連性を計算。
3. アナロジータスクの解決:
ベクトルの演算で単語間の関係性を表現。
例: $ \text{king} - \text{man} + \text{woman} = \text{queen}
https://en.wikipedia.org/wiki/Word_embedding
https://ja.wikipedia.org/wiki/単語の埋め込み
/miyamonz/Word embedding