大模型的权重到底怎么用?拆开一个 token 的生成过程
2026年9月9日2 分钟
我们已经知道,大模型里有很多参数,训练时会调整它们,平常聊天时通常不会。 但这还没回答一个最直观的问题: 一堆固定的数字,怎么就能变成一句新话? “经过注意力、FFN,最后预测下一个 token”这句
原文链接:掘金
我们已经知道,大模型里有很多参数,训练时会调整它们,平常聊天时通常不会。 但这还没回答一个最直观的问题: 一堆固定的数字,怎么就能变成一句新话? “经过注意力、FFN,最后预测下一个 token”这句
原文链接:掘金