第1129章 人工智能大时代开场 (第2/3页)
。
这两个问题,在2016年这个全球AI界连大模型门槛都没摸到的时间节点,确实是绝症。
没有任何论文可以参考,没有任何开源代码可以借鉴。
但在后世那个百模大战、大模型开源烂大街的2024年,这不过是教科书级别的新手问题。
如果没有前世的记忆,仅凭九天现有的这群天才,哪怕有雅安无尽的算力支撑,他们至少要在黑暗中摸索七到八个月,才能靠海量的试错堆出一个勉强可用的方案。
但是顾屿站在这里,“标准答案”就在这里。
“你们给奖励模型的权力太大了,模型更新的步子也跨得太宽。”
顾屿转过身,手中的马克笔在白板上迅速写下一行全新的数学推导公式。
“在PPO算法更新参数的时候,你们不能让模型像脱缰的野马一样为了讨好奖励模型而乱跑。必须引入一个参考模型,也就是你们做微调之前的那个初始底座模型。”顾屿条理清晰地抛出解法,
“每次新模型生成回答,不仅要看奖励模型给多少分,还要实时计算它和初始模型在词元输出概率上的分布差异。”
顾屿转头看向楼天城,给出了一个形象的比喻。
“打个比方,初始模型就像一个博览群书但口无遮拦的学者,它有自己正常的说话习惯和用词规律。当它为了迎合打分系统,开始满嘴车轱辘废话或者疯狂堆砌政治正确词汇时,它的语言分布就会发生剧变。我们要做的,就是用数学工具去量化这种变化带来的偏差。”
顾屿手中的笔尖顺着公式滑动:
“如果生成的回答偏离初始模型太远,偏差过大,就直接在最终奖励里进行大幅度扣分惩罚。逼着它既要回答人类想听的,又绝对不能偏离原本正常的语言逻辑规律。”
顾屿停下笔,目光扫过实验室里的众人:
“在信息论和概率统计里,衡量两个概率分布之间差异的这把标尺,全称叫做KUllbaCk-Leibler divergenCe,也就是库尔贝克-莱布勒散度。”
顾屿手臂发力,笔尖重重地在公式尾端写下两个大写字母。
“给它加入KL散度惩罚项。”顾屿敲击着白板,
“这样就能彻底锁死奖励黑客的漏洞。”
任少卿推了一下眼镜,盯着那个加上了KL惩罚项的方程。
楼天城从椅子上直接蹦了起来。
“对啊!拉住它的缰绳!”
“不仅要奖励它的讨好,还要惩罚它的过度变化。数学逻辑完全闭环,工程上绝对可行!”
林远站在后方,大脑飞速运转,他完全听懂了顾屿提出的这个概
(本章未完,请点击下一页继续阅读)
『加入书签,方便阅读』