AI 背后的数据结构

一条可以继续验证的思路

大模型肚子里的数据结构

这里有 2 篇文章,从一个词走向真实工作里的选择;先读懂,再决定要不要使用。

阅读线程开放
2篇札记
阅读方式先找到你卡住的地方,再顺着证据和取舍走

每篇可以独立阅读,也可以沿着这条线程继续。

AI 背后的数据结构无需登录

本页解决的问题

先给结论

什么是「大模型肚子里的数据结构」,它会影响哪些 AI 决策?

大模型原理篇见过分词,这次看底层:一棵前缀树怎么把「五花肉」整块认出来。亲手沿着 Trie 走一次分词 本页把相关概念、常见误区和实践文章放在同一条阅读线程里。

判断标准

先判断你卡在定义、选择还是验证,再从下方 2 篇文章中选择最接近的一篇。

下一步

从「词表与 Trie:Tokenizer 的切词秘密」开始,读完后用自己的任务复述结论。

常见误区

不要把同一主题下的所有方法当成可互换方案;输入、风险和验收标准变化时,答案也会变化。

这条问题线程

把一个词放回它真正影响的选择里。

2 篇札记
交互

词表与 Trie:Tokenizer 的切词秘密

大模型原理篇见过分词,这次看底层:一棵前缀树怎么把「五花肉」整块认出来。亲手沿着 Trie 走一次分词

AI 背后的数据结构 3 min →
交互

向量:RAG 检索是在「找最近的邻居」

Embedding 把语义变成坐标,相似度就是距离。在平面上拖动查询点看最近邻怎么变,再看 HNSW 为什么能在亿级向量里瞬间找到

AI 背后的数据结构 3 min →