确实,glm-5在做项目架构设计,后端接口的时候挺好用的,写前端的时候经常莫名其妙跑不通,或者一个问题反复改很多次也改不好,这个时候切kimi-k2.5一轮就解决了,kimi的前端能力还是很厉害的
minimax之前m2.1的时期,还用于glm-4.7资源不足时候的替代选择,但是到m2.5时期普遍反馈不好用,更不要说顶替同期的glm-4.7,5和kimi-k2.5,到m2.7出来后还没用过
大佬后续有考虑增加腾讯coding plan么,这个订阅的应该也挺多的
确实,glm-5在做项目架构设计,后端接口的时候挺好用的,写前端的时候经常莫名其妙跑不通,或者一个问题反复改很多次也改不好,这个时候切kimi-k2.5一轮就解决了,kimi的前端能力还是很厉害的
minimax之前m2.1的时期,还用于glm-4.7资源不足时候的替代选择,但是到m2.5时期普遍反馈不好用,更不要说顶替同期的glm-4.7,5和kimi-k2.5,到m2.7出来后还没用过
大佬后续有考虑增加腾讯coding plan么,这个订阅的应该也挺多的
需要在论坛退出重新登录~
希望加上真实任务的benchmark,模型速度只是一方面,主要是想看看质量
是,这个感觉需要定期测一轮.
不知道模型是不是存在降级.
些厂家是直接自动压缩了,导致一个工具使用不同模型差异挺大的.
但是他一直耍猴,抢不到他的优惠套餐,我连智谱的都能抢得到,但是就腾讯他家的一直抢不到,我也想慢慢抢,反正他家的测评时间也来得及,耍猴也算是一个评测内容。
已经有前端的一轮测试,我们是打算做全自动化的流程,就是比如说同样任务或者说不同的任务,然后还有评分的模型。这些东西我们都在考虑建设一整套的自动化流程,怎么样子展示好看以及直观。
好像说有些聚合平台会限制多模态能力,比如 kimi-k2.5 无法识别图片这是真的吗 ![]()
临时想到几个点,不知道合不合理能不能做,大佬看看
1.可以考虑适当调整拨测频率,自定义频率那种,高峰时段适当增加频率,低谷时段适当降低频率,动态平衡一下token消耗,拿到更多高峰使用时段的数据
2.可以考虑自动汇总出个每日总结报告?毕竟没有人每天盯着实时速度和质量页,而且指标也挺多的,可以汇总下速度,工具调用成功率,作品质量等指标出个简单每日综合的总结,方便快速比对,也方便历史平均对比。
月底就可以发《国内“词元”服务市场质量白皮书》了![]()
如果token以后会像网络,cdn等服务成为一项“基本”服务的话,那需要有第三方监测,倒逼厂商提高自身服务质量
3.关于质量部分,除前端外,可以考虑增加一些标准综合题库,不知道好不好搞。比如
a.前后端(现成接口):有厂商的现成的标准接口,进行接口对接,前后端的模块内容。
b.前后端(自有内部接口):需要自己写接口,但相对逻辑很标准的,登录验证增删改查的内部接口,后端写完接口前端调用生成页面的综合小模块,数据持久化(比如简单就sqlite)
c.debug 题:类似漏洞扫描准备一个待扫描镜像似的,提供一个含严重bug跑不起来或有明显问题的一段demo代码,让各模型debug,看错误解决的情况。又可以细分为逻辑问题和前端组件问题等。
jd也出coding plan了
直接跑分agentic的那几个数据集呗,让ai重新洗一下数据集
除了1,别的我们都在做了,我们目前的测试是,一小时同一时间连续三次,取平均值
2点的这个每日总结也考虑由ai生成了,目前的方案是,每日自动化实现x种任务,然后由教师模型进行评分
3点的题库,由于市面上很多题目国模有专调,最合适的方案是动态题库,让教师模型出题,每次题目随机,但是又会有影响是,模型生成出来的东西,除了给教师模型检查,可能很难打包给大家预览,容易处理的只有前端,后端大家看不到,
以及你说的前后端的题目,实测,国模没办法一轮跑完,如果给多轮,有的模型要三轮,有的模型四轮,这个不一致,无法判断模型能力,我的想法是一轮内的完善度最高是多少
题目都好出,主要是题目是否可以满足性价比的测评,可以快速的诊断出模型有没有量化,或者降智
京东plan买了,一会处理
OKOK,很赞
欢迎大佬
可能人少呢 抢不到
大佬,能力面板多久跑一次,我看jd的速度数据当天就有了,能力两天了还没看到
近期会更新,最近几天比较难,这个还是手动的,因为在整合公益站和测速聚合起来
打算公益站大家调用的时候直接测速,然后这个能力面板每天0点的时候自动化一轮看看
京东目前限制比较多,销售量不高,还可以
这量化是否能测出来? 海外平台有些会标识量化参数.