节的标题:【长时记忆】。
“现在汤圆很强,但是它的工作是响应式的。”姜亦心说道,“我问一个问题,它回答一个问题;我追问下一个问题,它回答下一个问题。等到我问的问题太多了,超出了上下文窗口,整个对话就没法用了,然后打开下一个问题,一切从头开始。我们做御风的时候就对这个问题特意做了优化,然后在做这个成长助手的时候,我们遇到了同样的问题。”
这确实是在一线应用开发中才会遇到的痛点。
韩路一回头看了看苏念念,她最近做经营管理比较多,已经脱离产品一线一段时间了。
韩路一怕苏念念听不懂,停下来做了一些讲解——当然,他是对着姜亦心说的,只是让苏总顺便听一下。
“大模型进行生成的时候,就是把所有的上下文都放进模型里跑一遍,最后得出答案,所以上下文给的越多,占用的内存就越多,这个量有个极限大小,就是上下文窗口。”韩路一说道,“现在汤圆的上下文窗口是二十万个词元,这个量不算小,如果只是日常问答是够用的,但是在工程中使用的话就捉襟见肘了。”
“超出上下文窗口之后,大模型还能继续工作,但是它就会默默地忘记用户最一开始说的话,给出的答案很多时候都驴唇不对马嘴了,而用户还不知道是哪里出了问题。”
为了形象说明,韩路一讲了个网上的段子。
“有人说,你在和大模型聊天的时候,可以在最一开始加一个要求,让他在每一个回答最后都加一个‘喵’,等他什么时候大模型突然回答不带‘喵’字了,你就知道他已经超出上下文窗口了,需要换一个新的聊天进程了。”
苏念念确实不知道这些,尤其是最后的那个段子,她轻轻点了点头。
“所以在汤圆的上下文窗口有无限大之前,我们只能让它回答窗口里能撑得下的回答。”姜亦心总结道。
这个总结很到位。
把问题分析完之后,姜亦心终于翻到了她的提案。
ai技能。
“这是什么?”韩路一开口问道。
姜亦心想了想,说道:“可以理解成一种可复用的行动脚本。”
她怕这个解释太虚,又换了个说法。
“比如说,我想要一个运营复盘的技能,模型知道怎么写复盘,但每次都要从头思考,像一个很聪明但没受过公司培训的新人。ai技能就是把公司里成熟员工的做法沉淀成一套固定动作,什么时候触发,先