从零 (RL) 训练一个五子棋神经网络模型

大家好,我回来了。

为什么突发奇想来训练模型了?

其实之前一直在尝试去vibe coding一些应用和网页,但vibe多了总感觉没什么意思。像是app这类东西,复杂的vibe不出来,简单的其实就是重复造轮子(可能轮子还不如别人的好)。

那么有没有什么既简单,又有意思的,甚至还能给自己积累一些经验的东西呢?
有的兄弟有的,可以尝试和coding agent在电脑上练小型ai模型

为什么这件事情之前很难做?
对于非专业人士,环境安装不说,一大堆魔法数字和调参就已经足够劝退了。训练的时候看着一堆曲线,什么v-loss p-loss reward entropy,其实很难琢磨透。但是如今的coding agent已经可以胜任这些任务。

本着体验的心态,我打算去尝试一下。使用opencode + dpsk v4pro

我是如何与deepseek合作的?

deepseek新增更好的训练模式

讨论合理的架构、参数量和魔法数字

和deepseek老师对话,它帮你看训练情况

……
……


最终,经过一晚上的vibe,烧了几块钱的token(opencode go里面的)以后,我获得了这个东西::backhand_index_pointing_down:
这个前端界面里面,可以查看训练曲线和训练状态,然后选择模型以后和ai对战
(黑的是ai,还有点强)

当然这也是有几个后端的。
首先有一个网页服务器。因为需要实时更新信息,还要和ai博弈。


其次需要一个训练的控制台,我直接选terminal了。


那么它有什么问题吗?
有的。前面尝试的 RL + mlp 发现总是崩掉。不是熵崩就是loss崩。然后我们加入了一个老师模型,去指导它做最关键的几步,训练了一晚上仍然不理想,只有中间几个ckpt效果比较好。

所以和deepseek讨论以后,我现在正在训练新的 cnn 网络,打算不加teacher,纯 RL ,cnn天生适合这些棋盘,我认为应该会有一些好的效果。(仍然在训练)

当然这远非一个专业的实践,更像是普通人的一个玩具。
但在自己的电脑上练一个ai,也挺有意思的吧

6 个赞

大佬回来了~

1 个赞

cnn效果好的话,我还可以尝试transformer,本质上就是一句话+几块钱token的事情,炼丹呗hhh

咱算力跟大模型公司差距太大,意义就只是纯练手吗

嗯。这是玩具,但也挺有意思的

训练在我的笔记本上完成,门槛很低

练完手去大模型公司搞真家伙

这玩意有点意思

1 个赞

刷B站在评论区看到一张眼熟的图 :zany_face: 赛博偶遇了 :rofl:

1 个赞