今天上班路上,突然有一个新的idea。
仿生地说,人脑是个自动更新参数的大模型,但是现在的大模型参数是固定的。靠skill.md和Agent.md 的注入来完成任务,本质上是一个不会进步的人,只有很有限的记忆,再通过反复阅读说明书来完成任务。
模型本身的进步全靠大模型厂商对于任务的优秀数据的训练和分批发布。
人的进步是因为人在看了书之后进行实践,在这个实践过程中,对应的神经网络的权重会根据现实世界的反馈得到强化和更新。 而这不是一种全参数更新,更像是一种针对特定任务的微调。所以人在看说明书做一件事做了10次之后,第11次他就不需要说明书了
如果说,可能的话,是不是可以在大模型的参数的后面几层,或者是有一个更小的网络耦合在主干之后,专门用来维护更新原始输出后的good case和bad case的持续再训练。