【阳仔测评】在项目开发中DeepSeek V4 Flash的token成本和落地成本

背景:AI圈热炸,DeepSeek斩杀线惊现

2026年7月31日,暑期北京的早晨异常炎热,AI圈的热浪更是一浪高过一浪。
大洋彼岸的OpenAI宣布5.6系列的Terra、Luna分别降价20%和80%;早晨上班路上偶然刷到GLM官宣新增1GW算力中心,同步官网解除订阅限制随时可下单。
下午,DeepSeek V4 Flash-0731(以下统一简称ds4-f)版本横空出世,被历史又一次记录新的“DeepSeek时刻”。

同时,Flash新版本在平衡模型评测指标和tokens定价方面,也带来了一个新的名词——DeepSeek斩杀线

当一个模型以更低的价格提供相近的能力时,那些缺少明显优势、却仍维持高价的产品,将面临更大的生存压力,因为企业没有必要为相似效果支付数十倍费用。


我的日常与诱因

今年4月份伊始,奥特曼经常搞一些活动,圈子里朋友们也都捧场,我也逐渐冷落了冷(高)艳(昂)的Claude,常规工作都由GPT协(总)调(包)开发,整体体验智能程度和项目推进速度比较满意,一直是持续付费。

ds4-f的价格实在是让人经受不住诱惑
我在思考:如何去评价一个大模型的使用成本?
不应该仅关注于 tokens/1M 的定价,也应该从实际的项目落地的成本中考量。如果一个模型只是便宜但是不聪明,轻则少量亏钱,重则拖垮项目进度或者黄掉,这也是不小的一笔投资。


测试项目:开放词汇目标识别测试系统

我最近开发一个开放词汇目标识别的测试系统,跟一些朋友对接了好几轮需求,项目结构已完成完整设计,且经过两组朋友的测试项目已通过功能验证。
于是,我开始了 Reasonix + ds4-f 的前端重构UI优化,做一轮项目落地成本测试。

  • 测试时间:8月3日晚开始,8月7日下午结束
  • 工作强度:中间开发零零散散,好在只是做UI升级,难度整体偏小
  • 测试项目内容:公司组内的一个测试平台,包含了测试平台面板 + 测试页面 + 跑批 + 分析 + 服务端增减worker + 硬件性能报告(重点模块)

测试过程中的群友互动日志(图片保留)

image

image


测试过程的“心电图”式体验

整个测试过程,心情和效率如同过山车,大致经历了以下几个阶段:

  • :rocket: 真提气 +60
    DeepSeek模型响应真快,配合 Reasonix 简直完美,思路清晰,tokens输出疾速,开局极度舒适。

  • :beer_mug: 醉酒中 -15
    对于讨论和开发边界不清晰,出讨论方案听成了直接开干!估计是Reasonix设计的问题(也可能是我的问题……)。

  • :tired_face: 马大哈 -40
    针对原项目已经出了升级后的UI设计稿,需要他引入原项目数据填充新UI,他总是落下点东西,需要人工纠错他来改。次数之多,让人崩溃,人工陪护成本较高。

  • :speaking_head: 话痨了 -20
    针对出现的多次开发遗漏小尾巴被抓住,在之后的对话中逐渐话痨,反复确认,输出量暴涨。

  • :artist_palette: 欣赏了 +40
    最后的设计成果和对接程度,很满意,方方面面到位。就算是GPT-5.6-Sol出这个设计成果,我也是满意的。

  • :collision: 夯爆了+666
    人工参与陪护成本较高,零散时间拉长战线近4天,但是——一共花了十块钱(tokens消耗2.4亿附近)!


小结

价格是真香,能力是真够,但“人工纠错”的隐性成本也需要正视。
不过,4天、2.4亿 tokens、10块钱,换来一套完整可用的UI重构 + 满意的设计质量,这笔账怎么算都值了。

如果你也在纠结要不要切到 ds4-f,我的建议是:可以冲,但记得留好人工陪护的余量 :grinning_face_with_smiling_eyes:


欢迎评论区交流你们的落地成本体验~

1 个赞

原UI基于Python内HTML字符渲染页面,新UI基于nextjs全栈式开发,原生适配原有AI服务端,服务端0代码改动。