peopleevents
梁斌penny 2025-05-28 07:30+08:00Z
原微博

不用购买外部数据了?利空我厂

@刘群MT-to-Death

连续看到两篇大模型无监督强化学习训练的文章,都不用外部的奖励信号了,直接使用模型的内部信息来做奖励,其中一个是利用输出的预测熵(predictive entropy),另一个是用输出的置信度(self-certainty),两种方法似乎有异曲同工之妙。如果连外部奖励信息都可以不用了,那强化学习的应用场景又可以大大扩展,前景不可限量啊!

上一页704/995每页 10总共 9943下一页