YouTube2Text

LLMはどう知識を記憶しているか | Chapter 7, 深層学習 — Transcript

by 3Blue1BrownJapan · 484 words · 484 segments · language en · Watch on YouTube

Full transcript

  1. 0:00大規模言語モデルに例えばマイケル
  2. 0:02ジョーダンがするスポーツはという文を
  3. 0:04与えるとモデルはバスケットボールが次に
  4. 0:06来ると正しく予測することができますこれ
  5. 0:09はつまりモデルのどこかに何千おの
  6. 0:12パラメーターの中に特定の人物と特定の
  7. 0:14スポーツについての知識が保存されている
  8. 0:17ということになりますねそして一般にこう
  9. 0:20したモデルを触ったことがある方ならご
  10. 0:22存知だと思いますがモデルはたくさんの
  11. 0:24ことを記憶していますさてモデルはどの
  12. 0:26ようにこれらの知識を扱っているの
  13. 0:28でしょうかどこにした知識があるん
  14. 0:30でしょう
  15. 0:31[音楽]
  16. 0:34か昨年12月GoogleDEEP
  17. 0:37mindの研究者たちはこの疑問について
  18. 0:40投稿していましたそこではアスリートと
  19. 0:42そのスポーツを対応させるという事例を
  20. 0:44扱っていました事実や知識がどのように
  21. 0:47管理されているかの完全な仕組みの解明に
  22. 0:49は至らなかったものの興味深い結果が得
  23. 0:51られましたざっくり言うとこうした知識は
  24. 0:54ネットワークの特定の部分多層
  25. 0:56パーセプトロン略してMLPと呼ばれる
  26. 0:59部分に保存されているようでした前回の
  27. 1:02動画まで私たちは大規模言語モデルや他の
  28. 1:05多くのAIの基礎となるアーキテクチャ
  29. 1:08トランスフォーマーについて詳しく見てき
  30. 1:10ましたね前回の動画ではアテンションと
  31. 1:12いう部分に注目していました今回は
  32. 1:15ネットワークの残りの大部分を占める多層
  33. 1:17パーセプトロンにおいて何が起こっている
  34. 1:19のか見ていきたいと思いますここでの計算
  35. 1:23はアテンションと比べると単純です基本的
  36. 1:25には行列の計算と他のあるものの
  37. 1:28組み合わせでできています
  38. 1:30しかしこうした計算を解釈することは
  39. 1:32極めて難しいものになり
  40. 1:35ます今回のゴールはこの計算を順に追って
  41. 1:38理解することですこうしたブロックが
  42. 1:41少なくとも原理的に知識を保存できると
  43. 1:43いうことを具体例を見ながら考えていき
  44. 1:45たいと思います具体的にはマイケル
  45. 1:48ジョーダンはバスケットボール選手である
  46. 1:50という知識に注目しますこの構成は
  47. 1:53グラント
  48. 1:58サンダーソンファームズ皆さんが前回まで
  49. 2:00の2つのチャプターをご覧になったか
  50. 2:02トランスフォーマーについての基本的な
  51. 2:04理解がある前提で進めますが念のため手
  52. 2:07身近におさいをしておきましょう
  53. 2:09かモデルはテキストの一部を受け取って次
  54. 2:12に何が続くかを予測し
  55. 2:14ます入力テキストはまずトークンと呼ば
  56. 2:17れる小さな部分単語やそれよりも小さい
  57. 2:20部分に分割されそれぞれのトークンが高
  58. 2:23次元のベクトル長い数のリストに対応して
  59. 2:25い
  60. 2:26ますこの1続きのベクトルは繰り返し2つ
  61. 2:30の演算を通ることになりますアテンション
  62. 2:32ではベクトル同士が情報を渡し合います
  63. 2:36それから今回見ていく多層パーセプトロン
  64. 2:38そしてその間には正規化のステップがあり
  65. 2:41ます1続きのベクトルがこうして両方の
  66. 2:44ブロックを繰り返し通ってきた後それぞれ
  67. 2:46のベクトルはコンテキストつまり入力に
  68. 2:49ある他の単語それから学習を通して重みに
  69. 2:52保存された一般的な知識から情報を吸収し
  70. 2:56ます最後にはここから次のトークンが何か
  71. 2:59推測できるようになってい
  72. 3:01ます思い出して欲しい重要な考え方はこれ
  73. 3:05らのベクトルは非常に高次元の空間にあっ
  74. 3:07てこの空間の異なる方向がある意味異なる
  75. 3:10意味を表しているということでし
  76. 3:15た例えば女性という単語の埋め込みから
  77. 3:18男性の埋め込みを引き算してそれを他の
  78. 3:21男性の名刺例えば叔父に足すと対応する
  79. 3:24女性の名刺葉に非常に近くなるんでし
  80. 3:28たある意味の特定の方向が性別の情報を
  81. 3:31持っていることになり
  82. 3:33ますこのようにこの高次元空間の他の
  83. 3:36異なる方向もモデルが表したい他の特徴に
  84. 3:39対応するということ
  85. 3:42ですトランスフォーマーではこれらの
  86. 3:45ベクトルは1つの単語の意味を超えた情報
  87. 3:48を持つことになりますネットワークを通っ
  88. 3:50ていくとトークンは周りのコンテキスト
  89. 3:52全てとモデルの知識からずっと豊かな意味
  90. 3:55を吸収し
  91. 3:57ます最後には次に来るものを足できないと
  92. 4:00いけないのでそれぞれのベクトルは1つの
  93. 4:02単語よりもずっとずっと多い情報を持つ
  94. 4:04ことになり
  95. 4:05ますすでにアテンションブロックが
  96. 4:08コンテキストをどう活用するかを見てき
  97. 4:10ましたが実はモデルのパラメーターの大
  98. 4:12多数はこのMLPブロックにありますこの
  99. 4:16部分が知識を保存する容量を追加している
  100. 4:19と考えてみても良いかもしれませんさて
  101. 4:21今回はマイケルジョーダンは
  102. 4:23バスケットボール選手であるという知識が
  103. 4:25どう扱われるかの例を見ていくんでし
  104. 4:28たここでこの高次元空間についていくつか
  105. 4:31の過程をしますまずある方向がマイケルと
  106. 4:34いう名前を表してい
  107. 4:36てそれとほとんど垂直な方向に苗字の上段
  108. 4:40があっ
  109. 4:42てそして3つ目の方向にバスケットボール
  110. 4:45があるということ
  111. 4:46[音楽]
  112. 4:48です例えばこのネットワークから処理中の
  113. 4:51ベクトルを1つ引き抜いて持ってきて見て
  114. 4:53みることにしますねこのベクトルと
  115. 4:56マイケルという名前の方向の内積が1なら
  116. 4:59このベクトルはこの名前の情報を持って
  117. 5:01いるという風に考え
  118. 5:04ますそれ以外の場合内積が0や負の値で
  119. 5:08ある時はベクトルがその方向を向いてい
  120. 5:11ないことになります簡単にするため内積が
  121. 5:141より大きい時は何なんだという質問は
  122. 5:16ここでは考えないことにします同様に他の
  123. 5:19方向との内積はこのベクトルが上段という
  124. 5:22苗字
  125. 5:24やバスケットボールの情報を持つかどうか
  126. 5:27を表しますなので例えばベクトルでフル
  127. 5:29ネームのマイケルジョーダンを表したかっ
  128. 5:31たらこれら両方の方向との内積が1になっ
  129. 5:34ていないといけないことになります
  130. 5:36マイケルジョーダンというテキストは2つ
  131. 5:38のトークンからなるのでこの前の
  132. 5:40アテンションブロックで2つ目のベクトル
  133. 5:42に両方の名前が表せるようにうまく情報が
  134. 5:45渡されたという過程もしないといけません
  135. 5:49ねではこれらの過程の元で今回の内容に
  136. 5:52入っていきましょう多層パーセプトロンで
  137. 5:54は何が起こっているのでしょうか
  138. 5:57[音楽]
  139. 6:001つきのベクトルがこのブロックの中を
  140. 6:02流れていくと考えますおさいですが
  141. 6:04それぞれのベクトルは元々入力のトークに
  142. 6:07対応したものでしたここではそれぞれの
  143. 6:09ベクトルにいくつかの計算をしていきます
  144. 6:12内容はすぐ後で見ていき
  145. 6:14[音楽]
  146. 6:15ましょうそして最後に来ると同じ次元数の
  147. 6:18別のベクトルが得られますこのベクトルが
  148. 6:20元々ブロックに入ってきたベクトルに加え
  149. 6:23られてこの我がブロックから出てくる結果
  150. 6:25になりますこれらの計算は1つ好きの
  151. 6:28ベクトル入力の遠君に対応する1つ1つに
  152. 6:31ついて並列で処理します特にこのステップ
  153. 6:34ではベクトルはお互いに情報を交換せずに
  154. 6:36ある意味1人1人自分のことをしている
  155. 6:38ような感じですということはこのブロック
  156. 6:40の中でこうしたベクトルのうちの1つに何
  157. 6:43が起こっているかを理解すれば全ての
  158. 6:45ベクトルについて何が起こっているか理解
  159. 6:47できるということになりますこのブロック
  160. 6:50がマイケルジョーダンはバスケットボール
  161. 6:52選手であるという知識を持つというのは
  162. 6:54どういうことかと言うとあるベクトルが
  163. 6:56入ってきて名前がマイケルで苗字が冗談と
  164. 6:59いう情報を持っていたらこれらの計算は
  165. 7:01バスケットボールの方向を含む何かしらの
  166. 7:03ベクトルを作り出してこれが元のベクトル
  167. 7:06に足されることになるということですさて
  168. 7:08最初のステップはベクトルと巨大な行列の
  169. 7:11掛け算の見た目をしていますま深層学習
  170. 7:13ですから驚きはないですねこの行列はこれ
  171. 7:16まで見てきた他の行列のようにデータから
  172. 7:18学習されるモデルのパラメーターでできて
  173. 7:21いますモデルの振舞を決め調整するつまみ
  174. 7:24やダイヤルのように考えることができます
  175. 7:26ねさて行列の掛け算はこのように考える
  176. 7:29こともできます行列のそれぞれの行をそれ
  177. 7:32自体ベクトルとして考えてこれらの行と
  178. 7:34処理されるベクトルの内積をたくさん取っ
  179. 7:37ていきます処理されるベクトルはここでは
  180. 7:39Eで表しています例えばこの最初の行が
  181. 7:43マイケルという名前の方向があるとして
  182. 7:44これに等しかったとしましょうすると出力
  183. 7:48の最初の成分この内積はもしこのベクトル
  184. 7:51がマイケルという名前の情報を持ってい
  185. 7:53たら1になってそうでなければ0や負の値
  186. 7:56になりますさらにこの最初の行がマイケル
  187. 7:59上段の方向だったらどうなるでしょう
  188. 8:03か分かりやすくM+Jと書くことにし
  189. 8:07[音楽]
  190. 8:08ますするとこの埋め込みEとの内積は綺麗
  191. 8:12に分配されてM.E+J.Eのようになり
  192. 8:16ますすると最終的な値はベクトルがフル
  193. 8:19ネームのマイケルジダの情報を持ってい
  194. 8:21たら2になってそうでなければ1やより
  195. 8:24小さな値になります他の全ての行も並行し
  196. 8:28てある意味質問を聞いているように処理さ
  197. 8:31れるベクトルの様々な特徴を調べている
  198. 8:33ように考えられ
  199. 8:37ますまたここでは出力にさらに別の
  200. 8:40ベクトルを足すことも多いですこれも
  201. 8:42データから学習したモデルのパラメーター
  202. 8:44ですねこのもう1つのベクトルはバイアス
  203. 8:46と言いますこの例ではこのバイアスの1つ
  204. 8:49目の成分の値が-1であると想像して
  205. 8:52くださいすると最終的な出力は対応する
  206. 8:55内積の値-1になりますもちろんなぜ
  207. 8:58そんなことするのかと思うかもしれません
  208. 9:01ここでベクトルがフルネームのマイケル
  209. 9:03ジョーダンの情報を持っている時にのみ値
  210. 9:05が正になってその他の場合0や不だと
  211. 9:08嬉しいんですがすぐにその理由は説明し
  212. 9:10ますねこの行列の行の数はある意味質問の
  213. 9:13数みたいな感じですが私たちが例にしてき
  214. 9:16たGPT3の場合には5万よりやや少ない
  215. 9:19くらいですこれは埋め込み空間の次元の数
  216. 9:22のちょうど4倍になっていますまこれは
  217. 9:24単なるデザインチョイスですね多くしても
  218. 9:26少なくしても良いですが整数倍だと
  219. 9:28ハードウェアに優しいことが多いみたい
  220. 9:30ですこの行列はたくさんの重みでより高い
  221. 9:33次元の空間にベクトルを移すのでWupと
  222. 9:36表記することにします処理されるベクトル
  223. 9:38はEそれからこのバイアスのベクトルはB
  224. 9:41アと呼ぶことにしてこのように下の図に
  225. 9:43書いておき
  226. 9:45ましょうさてここまでの問題点として計算
  227. 9:48が純粋に線形なのに対して言語はとても非
  228. 9:51線形なプロセスであるということがあり
  229. 9:53ます我々が測っている成分がマイケル+
  230. 9:56ジダンについて高い値ならこれはマイケル
  231. 9:58フェルとかアレクシスタスジダとかについ
  232. 10:01ても少なからず反応することになります
  233. 10:04しかしこれらは実際には概念的に無関係
  234. 10:06ですねここで欲しいのはフルネームについ
  235. 10:09ての単純なイエスかノかの答えですそこで
  236. 10:12次のステップではこの大きな処理中の
  237. 10:14ベクトルを非常に単純な非線形関数に通し
  238. 10:17ますこの関数でよく選ばれるのは負の値を
  239. 10:21全部0にして正の値をそのまま変えずに
  240. 10:23残すという関数ですこのとっても単純な
  241. 10:27関数はレクティファイリニアユニットと
  242. 10:29略してレルというそんなに単純じゃない
  243. 10:31名前がついていますグラフの見た目は
  244. 10:33こんな感じです先ほどの例を思い出すと
  245. 10:36この処理中のベクトルの最初の成分はフル
  246. 10:39ネームがマイケルジョーダンの時のみ1で
  247. 10:41そうでなければ0や2の値でしたこれを
  248. 10:44レルに通すと0Yoの値が全部
  249. 10:46クリッピングされて0になって綺麗な値が
  250. 10:49得られますなのでこの出力はフルネームが
  251. 10:51マイケルジョーダンなら1そうでなければ
  252. 10:540になります言い換えるとこれはアンド
  253. 10:56ゲートのフマを真似しています
  254. 11:01よくレルの代わりにこれを少し滑らかにし
  255. 11:03たジェルという関数の方が使われますが
  256. 11:06今回私たちが見ていくにはレルを使った方
  257. 11:08が分かりやすいでしょうまた
  258. 11:10トランスフォーマーのニューロンというの
  259. 11:12はこれらの値のことを言い
  260. 11:15ます一般的なニューラルネットワークの図
  261. 11:18で丸がたくさん層になって層をつなげる線
  262. 11:21がたくさん書いてあるものがありますね
  263. 11:23このシリーズでもありましたこれはこの
  264. 11:25線形の行列の席のステップとその後のレル
  265. 11:28のような単純な高ごとの非線形関数の処理
  266. 11:31を表現していますこのニューロンが正の値
  267. 11:35ならアクティブ活性であるといい0なら不
  268. 11:38活性であると言い
  269. 11:40ます次のステップは1つ目のステップに似
  270. 11:43ています巨大な行列と掛け算してバイアス
  271. 11:46を加え
  272. 11:47ます今回は出力の次元の数は埋め込み空間
  273. 11:51のサイズに戻ってきますなのでこれを
  274. 11:53ダウンプロジェクション行列と呼ぶことに
  275. 11:55し
  276. 11:56ましょうそして今度は行ごとに考えるより
  277. 11:59も列ごとに考えた方が分かりやすいです
  278. 12:03行列の掛け算のもう1つの考え方は行列を
  279. 12:06列ごとに取ってきてベクトルの対応する
  280. 12:08成分と掛け算してこれらの項を全て
  281. 12:10足し合わせ
  282. 12:17ますなぜこう考えると良いかと言うとここ
  283. 12:20では列は埋め込み空間と同じ次元数を持っ
  284. 12:23ているのでこれらの列を空間の方向として
  285. 12:26考えることができるからです例えばモデル
  286. 12:29がこの最初の列を我々が今存在を仮定して
  287. 12:32いるバスケットボールの方向として学習し
  288. 12:34たとしましょうするとこの最初の位置に
  289. 12:37対応したニューロンが活性の時この列が
  290. 12:39計算結果に足されることになりますもし
  291. 12:43このニューロンが不活性ならつまり値が0
  292. 12:45ならこの部分は何の影響も及ぼさないこと
  293. 12:48になりますそしてこれはバスケットボール
  294. 12:50以外にもモデルがフルネームのマイケル
  295. 12:52ジダに関連付けたい特徴を表すことができ
  296. 12:57ます同時にこの行列の他のそれぞれの列も
  297. 13:01対応するニューロンが活性の時計算結果に
  298. 13:03何が足されるかを表してい
  299. 13:07ますここでバイアスがある場合は
  300. 13:10ニューロンの値に関わらず毎回足している
  301. 13:12ものだと考えることができ
  302. 13:14ますこれが具体的に何をしているのかは
  303. 13:17パラメーターからなる他の部品同様解釈が
  304. 13:20難しいですもしかしたらネットワークが
  305. 13:22何かしらの情報管理をしているのかもしれ
  306. 13:25ませんが今は無視して大丈夫です今度も
  307. 13:27書き方をもう少し簡単ににするためにこの
  308. 13:30大きな行列をWダウンバイアのベクトルを
  309. 13:33Bダウンと書いて図に戻しておきましょう
  310. 13:36先ほど見たようにこの計算結果は初め
  311. 13:39ブロックに入ってきた対応するベクトルに
  312. 13:41足されこれが最終的な計算結果になり
  313. 13:45ます例えば入力のベクトルが名前の
  314. 13:48マイケルと苗字のジョーダンの両方の情報
  315. 13:50を持っていたらこの一連の計算でアン
  316. 13:54ゲートがオンになってバスケットボールの
  317. 13:56情報が足さ
  318. 13:57れ出力はこれら全ての情報を持った
  319. 14:00ベクトルになりますそしてこれはたくさん
  320. 14:03の並列の処理の1つでしたねGPT3の数
  321. 14:06で言うとこのブロックには5万ニューロン
  322. 14:08だけでなく5万か入力のトークンの数だけ
  323. 14:12のニューロンがあることになり
  324. 14:15[音楽]
  325. 14:19ますというわけでこれが全体の計算です
  326. 14:23それぞれバイアスが足される2つの行列
  327. 14:25計算と単純なクリッピングの関数ですね
  328. 14:28シリーズの最初のの動画を見た方は今見た
  329. 14:30ものが以前お話ししたニューラル
  330. 14:32ネットワークの最も基本的な形だとお
  331. 14:34気づきでしょう今回トランスフォーマーと
  332. 14:37大規模言語モデルに関してはこれは大きな
  333. 14:39アーキテクチャの1部分ですこれが具体的
  334. 14:43に何をしているのかのどんな解釈も高次元
  335. 14:45の埋め込み空間のベクトルで情報を表す
  336. 14:48ことと深く関係してい
  337. 14:51ますここまでがメインの内容ですがここ
  338. 14:54からは2点だけ少し戻って確認していき
  339. 14:57たいと思います1つ目はこれまでしてきた
  340. 14:59パラメータ数のカウントで2つ目は高次元
  341. 15:02についての重要な事実
  342. 15:03[音楽]
  343. 15:05ですここまでGPT3のパラメーターの数
  344. 15:08を数えてきましたから手近にこれを完成さ
  345. 15:11せ
  346. 15:12ましょう先ほど見た通りこのWup行列は
  347. 15:15およそ5万の行があってそれぞれの行の長
  348. 15:18さは埋め込み空間の次元数GPT3の場合
  349. 15:221228ですこれらを掛け算してこの1つ
  350. 15:26の行列で合計6億400万のパターが使わ
  351. 15:29れていますWダウンの行列も同じ数の
  352. 15:32パラメーターが横に倒したような形で使わ
  353. 15:35れていますなので合わせて12億の
  354. 15:37パラメーターが使われていますバイアスの
  355. 15:40ベクトルに使われるパラメーターの数は
  356. 15:42全体からすると大した割合ではないのでお
  357. 15:44見せする必要もないでしょうGPT3では
  358. 15:47埋め込みのベクトルは1つではなく96の
  359. 15:50異なる多層パーセプトロンブロックを通り
  360. 15:52ますなのでこれらのブロックの
  361. 15:54パラメーター数は全部で110億ほどに
  362. 15:57なります
  363. 15:59これは大体ネットワーク全体の
  364. 16:01パラメーター数の2/3ほどですここまで
  365. 16:04見てきたアテンションブロックや埋め込み
  366. 16:07掘り出しその他を全て合わせると最初に見
  367. 16:09たパラメーター数1750が得られ
  368. 16:13ますもちろん今回の説明では飛ばした正規
  369. 16:16化のステップに使われるパラメーターや
  370. 16:18先ほどのバイアスのようにもうちょっと
  371. 16:20パラメーター数はありますが全体で見た時
  372. 16:22の割合は非常に小さいもの
  373. 16:24[音楽]
  374. 16:26ですさて2点目ですがここまで見てきた例
  375. 16:29が実際にllmが知識を記録してる方法な
  376. 16:32のかと皆さん疑問に思うところでしょう
  377. 16:35まず1つ目の行列の行が埋め込み空間の
  378. 16:38方向として考えられてつまりそれぞれの
  379. 16:41ニューロンのアクティベーションが処理さ
  380. 16:42れるベクトルがどれだけ特定の方向に揃っ
  381. 16:45ているかを示しているというのはこれは
  382. 16:46あっていますそれから2つ目の行列の列が
  383. 16:49そのニューロンが活性の時足されるものを
  384. 16:51表しているというのもあっていますこれら
  385. 16:54はただの数学的な事実ですしかし実際には
  386. 16:58それぞれのロはマイケルジョーダンのよう
  387. 17:00に綺麗に1つの特徴を表していないことが
  388. 17:03ほとんどですそしてこれにはスーパー
  389. 17:05ポジション重ね合わせという現象が関連し
  390. 17:08てい
  391. 17:09ますこれは仮説でモデルの解釈がなぜ
  392. 17:13難しくそれからなぜうまくスケールするか
  393. 17:15の説明に役に立つかもしれないと言われて
  394. 17:17いますN事件空間があってこの空間の中で
  395. 17:21互いに垂直な方向を使って異なる特徴を
  396. 17:24表現することを考えましょうつまりある
  397. 17:27方向の成分を足してもそれが他の方向に
  398. 17:29影響を与えないということ
  399. 17:31ですするとちょうどこれができるベクトル
  400. 17:34の数は次元の数のNだけになりますねと
  401. 17:38いうか数学的にはこれが次元の定義でも
  402. 17:40ありますしかしここでこの制限を少しだけ
  403. 17:43緩くしてノイズを許容すると面白いことが
  404. 17:46起こりますぴったり直行するベクトルでは
  405. 17:49なくてほぼ直行している例えば89°から
  406. 17:5291°のベクトルで特徴を表すとし
  407. 17:57ましょうこれが2次元や3次元だったら
  408. 18:00ほとんど違いはありません全然ベクトルを
  409. 18:02詰められる余裕がないですからねしかし
  410. 18:05直感に反するかもしれませんが高次元では
  411. 18:08これは大きく異なってい
  412. 18:09ますPythonを使ってちょっとした
  413. 18:12資格化をしてみましょうランダムに100
  414. 18:14次元のベクトルのリストを作ることにし
  415. 18:16ますそしてこのリストは1万の異なる
  416. 18:19ベクトルを含むことにします次元の数の
  417. 18:22100倍です
  418. 18:23ねこの図はこれらのベクトルのペアについ
  419. 18:26て角度の分布を表しています
  420. 18:29ランダムに始めたのでこれらの角度は0
  421. 18:31から180°の何でもあり得るわけですが
  422. 18:34すでにランダムなベクトルについても
  423. 18:3690°あたりに固まる傾向があるのが見
  424. 18:38られます
  425. 18:40ね次にとある最適化のプロセスを実行して
  426. 18:43これらのベクトルを繰り返し少しずつ
  427. 18:46ずらしてあげて互いに垂直に近づくように
  428. 18:48してあげますこれを何度も繰り返すと角度
  429. 18:52の分布はこんな風になります拡大してみて
  430. 18:55みると全てのベクトルのペアについての
  431. 18:57角度はこの8°から91°の狭い範囲に
  432. 19:01あることが分かり
  433. 19:02[音楽]
  434. 19:04ます一般にこうした結果はジョンソン
  435. 19:06リンデストロースの補題と呼ばれますこの
  436. 19:09ように互いにほぼ垂直に空間に押し込める
  437. 19:12ベクトルの数は次元の数について指数的に
  438. 19:15増えるようです独立したそれぞれの概念を
  439. 19:19ほぼ垂直な方向に対応させるllmにおい
  440. 19:22てこれは非常に重要になりますつまり
  441. 19:25llmが空間の次元の数よりもずっとず
  442. 19:28多くの概念を記録することができることに
  443. 19:31なりますこれはモデルの性能がサイズと共
  444. 19:34にうまくスケールする理由の1つかもしれ
  445. 19:36ません10倍の次元数の空間は10倍より
  446. 19:40ずっとずっと多くの独立した概念を記録
  447. 19:42でき
  448. 19:44ますこれはモデルに流れるベクトルがいる
  449. 19:47埋め込み空間だけでなく先ほど見た多層
  450. 19:50パーセプトロンブロックの途中の
  451. 19:52ニューロンがたくさんのベクトルについて
  452. 19:53も同様です例えばGPT3のサイズでは
  453. 19:575万の特徴についって調べているのでは
  454. 19:59なくこの空間でほぼ垂直な方向を活用する
  455. 20:02ことで処理されるベクトルのずっと
  456. 20:04たくさんの特徴を調べている可能性があり
  457. 20:07ますその場合1つ1つの特徴は1つの
  458. 20:11ニューロンの点灯のようには見えないこと
  459. 20:12になります代わりにこれらのニューロンの
  460. 20:14特定の組み合わせの見た目重ね合わせに
  461. 20:17なります興味のある方へこれに関連する
  462. 20:21キーとなる用語はスパースオートエ講座
  463. 20:23ですこれら全てのニロについて重ね合わせ
  464. 20:26が起こっていても実際の特徴量につつて
  465. 20:28調べられる方法ですいくつかアンソロ
  466. 20:31ピックの投稿を概要欄に貼っておきます
  467. 20:34ここまでトランスフォーマーの全てでは
  468. 20:36ありませんが重要な部分を見てきまし
  469. 20:39た次のチャプターでは学習のプロセスを見
  470. 20:42ていき
  471. 20:43ます学習は基本的にバック
  472. 20:46プロパゲーション逆電波でこれまでの
  473. 20:48シリーズでもすでに扱ったものですしかし
  474. 20:51言語モデルに使われる特定のコスト関数や
  475. 20:53人間のフィードバックを使った強化学習に
  476. 20:56よるファインチューニングそして
  477. 20:57スケーリング速などともう少しお話しし
  478. 20:59たいと思い
  479. 21:01ますところで機械学習以外にも制作されて
  480. 21:04いる動画はあるのでシリーズの次の
  481. 21:06チャプターは少し先になるかもしれません
  482. 21:08が是非他のトピックもご覧になってお待ち
  483. 21:27くださいDET
  484. 21:31[音楽]

About this transcript

This page contains the full transcript of LLMはどう知識を記憶しているか | Chapter 7, 深層学習 by 3Blue1BrownJapan, generated from the public captions YouTube serves with the video. The transcript has 484 words across 484 segments, with the original timestamps preserved so you can click any line to jump to that moment in the embedded player.

What you can do with it

Use the transcript to take notes, quote the speaker, build a study guide, generate a summary with ChatGPT or Claude via the YouTube Summary tool, or export it as a timed subtitle file with YouTube to SRT. You can also re-open it in the transcriber to translate the transcript into 100+ languages.

Free YouTube transcript tool

YouTube2Text is a free YouTube transcript generator — no signup, no daily limit. Paste any YouTube link and get the full transcript instantly, with timestamps, click-to-jump, translation to 100+ languages, AI prompts for ChatGPT, Claude, and Gemini, and exports to TXT, SRT, VTT, or Markdown.