😀编辑词表,增加特殊token,并且使用相关的token进行初始化1. preparation加载模型设置 special tokens保存 model 和 tokenizer 2. 更新并初始化模型的embeddings更新embedding新token和旧token在模型内部的表示(即embedding)是非常相似的,主要是因为我们通过计算旧token的embedding均值来生成新token的embedding。这使得新token能够在模型中具有与旧token相似的表示,从而保证模型能够理解并正确处理这些新token。 保存模型 3. 全部串起来作者:SimonSun链接:https://blog.simonsun.cc//article/llm-5声明:本文采用 CC BY-NC-SA 4.0 许可协议,转载请注明出处。相关文章Attention Residuals 残差进化史MoE 模型的路由重放 → R3Verl vs AReaL扫盲 reward hacking 和 熵坍缩扫盲 Online / Offline & On-policy / Off-policy扫盲KL散度和交叉熵PPO(0)强化学习基础2024北京初雪