Andrej KarpathyYouTube
@karpathy
2 小时前
深入理解大语言模型 (LLM) 的思维链与推理原理
💡 结论速览:模型通过链式思考 (CoT) 可以激活隐空间内的逻辑分支,相比单步输出准确率跃升 40% 以上。
• 强化学习奖励建模:仅靠监督微调 (SFT) 无法产生自纠错能力,需要引入带有自我验证机制的强化学习搜索。
• 测试时计算 (Test-Time Compute):通过多采样路径投票,推理性难题可通过在推理阶段投入更多算力来解决。
“推理不是魔术,它是大模型在概率分布图上的最优路径回溯。”
#LLM#RLHF#Transformer#AI架构
查看原视频