大家好,我回来了。
为什么突发奇想来训练模型了?
其实之前一直在尝试去vibe coding一些应用和网页,但vibe多了总感觉没什么意思。像是app这类东西,复杂的vibe不出来,简单的其实就是重复造轮子(可能轮子还不如别人的好)。
那么有没有什么既简单,又有意思的,甚至还能给自己积累一些经验的东西呢?
有的兄弟有的,可以尝试和coding agent在电脑上练小型ai模型
为什么这件事情之前很难做?
对于非专业人士,环境安装不说,一大堆魔法数字和调参就已经足够劝退了。训练的时候看着一堆曲线,什么v-loss p-loss reward entropy,其实很难琢磨透。但是如今的coding agent已经可以胜任这些任务。
本着体验的心态,我打算去尝试一下。使用opencode + dpsk v4pro
我是如何与deepseek合作的?
deepseek新增更好的训练模式
讨论合理的架构、参数量和魔法数字
和deepseek老师对话,它帮你看训练情况
……
……
最终,经过一晚上的vibe,烧了几块钱的token(opencode go里面的)以后,我获得了这个东西:![]()
这个前端界面里面,可以查看训练曲线和训练状态,然后选择模型以后和ai对战。
(黑的是ai,还有点强)
当然这也是有几个后端的。
首先有一个网页服务器。因为需要实时更新信息,还要和ai博弈。
其次需要一个训练的控制台,我直接选terminal了。
那么它有什么问题吗?
有的。前面尝试的 RL + mlp 发现总是崩掉。不是熵崩就是loss崩。然后我们加入了一个老师模型,去指导它做最关键的几步,训练了一晚上仍然不理想,只有中间几个ckpt效果比较好。
所以和deepseek讨论以后,我现在正在训练新的 cnn 网络,打算不加teacher,纯 RL ,cnn天生适合这些棋盘,我认为应该会有一些好的效果。(仍然在训练)
当然这远非一个专业的实践,更像是普通人的一个玩具。
但在自己的电脑上练一个ai,也挺有意思的吧






