cbottle模型改进中的困惑
在做cbottle的模型改进工作,现在在用SFT,因为模型在海温的欠响应是线性的。而且RL不仅很贵,现在能用作RL奖励的唯一机制,恰好也是那把尺子。
只是现在非常担心,这个气候模型有45个场,我这样修真的算“修好了”吗?现在正负不对称(减温度的响应和升温不一样)海冰区又涨过头了(可能是训练时海温一直被钉在冰点,模型没学过那里的波动———那不还是没学会物理嘛😑)水汽又涨到150%了。
下一步该如何是好啊,感觉对RL的理解还是太浅了,科研直接什么的也太抽象了,一会儿要求你充满逻辑,又有时候你要有Novelty,直接这个词本身不觉得有点扯淡吗。总感觉有些更高维的东西没有被描述出来… 上面说的那些直觉和逻辑又都是真实存在的,头大。
