MWD
08-31 09:44
你发这玩意,你自己懂不
DeepSeek的斩杀线一夜被斩杀,便宜大碗才是真旗舰
免责声明:上述内容仅代表发帖人个人观点,不构成本平台的任何投资建议。
分享至
微信
复制链接
精彩评论
我们需要你的真知灼见来填补这片空白
打开APP,发表看法
APP内打开
发表看法
{"i18n":{"language":"zh_CN"},"detailType":1,"isChannel":false,"data":{"magic":2,"id":602536490824696,"tweetId":"602536490824696","gmtCreate":1788140688702,"gmtModify":1788140690759,"author":{"id":3440149895560920,"idStr":"3440149895560920","authorId":3440149895560920,"authorIdStr":"3440149895560920","name":"MWD","avatar":"https://static.tigerbbs.com/533b1db95dee7a993055dbdb2ca4120d","vip":1,"userType":1,"introduction":"","boolIsFan":false,"boolIsHead":false,"crmLevel":1,"crmLevelSwitch":0,"individualDisplayBadges":[],"wearingBadges":[],"fanSize":31,"starInvestorFlag":false},"themes":[],"images":[],"coverImages":[],"title":"","html":"<html><head></head><body><p>你发这玩意,你自己懂不</p></body></html>","htmlText":"<html><head></head><body><p>你发这玩意,你自己懂不</p></body></html>","text":"你发这玩意,你自己懂不","highlighted":1,"essential":1,"paper":1,"likeSize":0,"commentSize":0,"repostSize":0,"favoriteSize":0,"link":"https://laohu8.com/post/602536490824696","repostId":2662034957,"repostType":2,"repost":{"id":"2662034957","kind":"news","pubTimestamp":1787846460,"share":"https://www.laohunote.com/m/news/2662034957?lang=zh_CN&edition=full","pubTime":"2026-08-28 00:01","market":"us","language":"zh","title":"DeepSeek的斩杀线一夜被斩杀,便宜大碗才是真旗舰","url":"https://stock-news.laohu8.com/highlight/detail?id=2662034957","media":"爱范儿","summary":"作为对比,现阶段涨价后的 DeepSeek V4 Flash 价格是每百万 Token 输入是 1.5 元,输出 4.5 元,缓存命中 0.05 元,而高峰时段还是空闲时段的两倍。持续的调用,让这个“牛来”模型终结了 DeepSeek 在 OpenCode 上长达 56 天的霸榜。前段时间,我们在《DeepSeek 给大模型划出的“斩杀线”,斩的到底是什么》里给“斩杀线”下过一个定义:足够高的任务完成率 × 足够低的总任务成本,从而夺走默认调用位。","content":"<html><body><p>刷屏快一周的匿名模型“牛来”,正式揭晓了真身。</p><p>8 月 26 日晚,<a href=\"https://laohu8.com/S/02513\">智谱</a>正式上线并开源了 GLM-5.3 Flash,确认它就是 8 月 20 日起以 Ox-Alpha 代号,在大模型聚合平台 OpenRouter 和 OpenCode 上匿名测试的那个模型。</p><p><img decoding=\"async\" loading=\"lazy\" src=\"https://x0.ifengimg.com/res/2026/3F17532260548FC81B43784E2B499AC43AFF03B6_size461_w1080_h1391.png\"/></p><p>说起来,这是智谱第二次用这种匿名模型先免费跑一周赚流量,然后再官宣认领,上次是“马来”。春节前夕的 Pony-Alpha,后来被证明是 GLM-5。</p><p>就在同一晚,<a href=\"https://laohu8.com/S/09988\">阿里</a>也发布了一款新模型,且一样是 Flash 款。Qwen3.8-Flash 正式在大模型开源平台 Hugging Face,和阿里的模型开源社区魔搭 ModelScope 开源权重。</p><p>特别的是,千问这款新模型,虽然是 Flash,但是却作为 Qwen4 架构的早期预览版,用的是下一代 Qwen4 模型的新架构。</p><p><img decoding=\"async\" loading=\"lazy\" src=\"https://x0.ifengimg.com/res/2026/2C4AE8F2EE5B6524F5240D76193D03E9A7DFE087_size742_w1080_h1248.png\"/></p><p>架构之外,两个新模型的 benchmark 数据和具体表现,也一点不像是原本我们对 Flash 的印象,即旗舰/Pro 模型的删减版。</p><p>GLM-5.3-Flash 拥有百万上下文,也是 GLM-5 系列的第一个原生多模态模型,图片、视频、文件、Coding,以及 Computer Use 这些功能现在全部靠模型就能做到。</p><p>Qwen3.8-Flash 同样保留百万上下文、图像和视频输入,结合千问办公,生成速度提升 100%,Token 消耗减少 75%。</p><p><img decoding=\"async\" loading=\"lazy\" src=\"https://x0.ifengimg.com/res/2026/CB3EF729184928C5AD0914426EE17BFDF018882B_size193_w1080_h673.png\"/></p><p>图|GLM-5.3 Flash 在多个 benchmark 上的表现基本在 Opus 4.8 的水平</p><p>与此同时,极致性价比和普惠是这两款模型的定位。GLM-5.3-Flash 的定价前所未有,限时折扣内每百万 Token 输入是 0.4 元,输出 1.4 元,缓存命中 0.115 元,是 GLM-5.3 的 1/20。</p><p>Qwen3.8-Flash 的价格同样感人,每百万 Tokens 输入仅 1 元、输出 3 元,是 Qwen3.8-Max 的 1/12。</p><p>作为对比,现阶段涨价后的 DeepSeek V4 Flash 价格是每百万 Token 输入是 1.5 元,输出 4.5 元,缓存命中 0.05 元,而高峰时段还是空闲时段的两倍。目前高峰时段为北京时间周一至周五 9:00 - 12:00、14:00 - 18:00,其余为空闲时段。</p><p>一边要比较模型界的“拼多多”DeepSeek V4 Flash 的价格,一边又要比较智能上限,动不动就对标 Claude Opus 5、Fable 5 等。</p><p><img decoding=\"async\" loading=\"lazy\" src=\"https://x0.ifengimg.com/res/2026/0E206A84EDAAE7DA02447B6E58813AA750363F39_size73_w1080_h333.png\"/></p><p>图|DeepSeek V4 系列模型价格,从左至右为 V4 Flash、V4 Pro、V4 Flash Vision 实验版</p><p>Flash 似乎正在摆脱过去“砍参数、砍多模态、砍上下文”换低价的定位,从一句“够用就好”,变成大模型厂商新的竞争重点。</p><p>和 Opus 4.8 得分持平</p><p>OpenCode 的界面仍然显示着,ox-alpha 有 50.5 万个独立用户标识,累计消耗 Token 达到了 44T,完成超过 1300 万个会话,输入 Token 的缓存比例达到 93%。</p><p>这些数字能证明大量调用发生在 Coding Agent 平台,即便是匿名身份也没有阻挡住开发者对这款新模型的使用热情。</p><p><img decoding=\"async\" loading=\"lazy\" src=\"https://x0.ifengimg.com/res/2026/19EF27422AA9B41EAE15C391FB800A14DE4571AD_size61_w1080_h575.png\"/></p><p>持续的调用,让这个“牛来”模型终结了 DeepSeek 在 OpenCode 上长达 56 天的霸榜。</p><p>而来自模型调用的算力压力,智谱后续则提到,这些请求流量全部由国产芯片提供算力支持,他们调用了超过 10 万张国产芯片做推理服务,并在技术文档中表示其集群“硬件效率及单位 token 成本已经达到了与主流英伟达 GPU 相当的水平”。</p><p>我们简单测试了一下 GLM-5.3-Flash 的能力,目前它在智谱官方的 Coding Agent 平台 ZCode 上可以直接体验。官方平台的 BigModel、Coding Plan 等 API 接入也已经开启调用。</p><p><img decoding=\"async\" loading=\"lazy\" src=\"https://x0.ifengimg.com/res/2026/B069D75D0D6B963B74D692988C7FB32218DE4DB4_size208_w1080_h720.png\"/></p><p>多模态的视觉能力是 GLM-5.3-Flash 的新增能力,我们上传了 X 上最近比较火的二维码项目视频。平视是一棵树,但是当我们拖拽鼠标切换不同视角,俯视时,这棵像素块组成的树就变成了一个可扫描的二维码。</p><p>GLM-5.3-Flash 可以自动读取视频,但工作时间和我们之前的测试一样,ZCode 要花较长的时间进行思考。似乎并没有因为模型是 Flash,而导致任务的执行时间有变短。</p><p>最终实现的项目也是可以用的,但是如动图所示,整个网页非常卡顿。</p><p><img decoding=\"async\" loading=\"lazy\" src=\"https://x0.ifengimg.com/res/2026/F1E49D954C458ECD94C49A04C77D5604F2BC21DA_size686_w1079_h646.gif\"/></p><p>我们要求 GLM-5.3-Flash 分析卡顿原因,它自己也提到,之前的实现每一帧都要重新绘制整个场景。</p><p>而整个场景有将近 1300 块地砖,每块最多 5 个面(顶面 + 4 面墙),再加投影计算里每点都算一遍三角函数,鼠标拖拽的每帧,就有约 6000 次路径填充、2 万次三角函数,60fps 下非常吃力。</p><p>修复之后的版本要好上不少,动画更加丝滑,拖拽也不卡顿,切换主题样式时渲染都更快。</p><p><img decoding=\"async\" loading=\"lazy\" src=\"https://x0.ifengimg.com/res/2026/EEB348B0895202F50A7803C80A4957341000523E_size1472_w1079_h646.gif\"/></p><p>而整个项目从读取视频,到实现这个 3D 效果的二维码网页,以及二次修改;ZCode 内显示的应用用量消耗是将近 3000 万 Token,个人套餐内的 5h 剩余额度还有 98%,每周额度则是剩余 99%。</p><p><img decoding=\"async\" loading=\"lazy\" src=\"https://x0.ifengimg.com/res/2026/F33980351B177CDB9AFC1B52CADEA8B1A8E75F38_size70_w1080_h396.png\"/></p><p><img decoding=\"async\" loading=\"lazy\" src=\"https://x0.ifengimg.com/res/2026/46E26BF7C48986DDB35CE68E1AB13CCD16B28570_size59_w1080_h516.png\"/></p><p>我们继续使用 GLM-5.3-Flash 进行测试,模型的多模态能力很好地帮助 ZCode 可以持续截图,通过视觉识别自身生成的内容,以及用“试玩”等方式来找到输出结果中不合理的部分。</p><p>同样是之前在 X 上比较热门的中国宝塔案例,模型需要使用 3D 库, 生成一座中国宝塔,朱漆绿釉,顶部饰以鎏金的完整搭建过程。</p><p><img decoding=\"async\" loading=\"lazy\" src=\"https://x0.ifengimg.com/res/2026/895B33B40A4007AAEE6A105EF0E797FF190C999B_size168_w1080_h647.png\"/></p><p>GLM-5.3-Flash 似乎参考了二维码花园的项目,导致这个中国宝塔也采用了和之前一样的像素风格,整个用时 57 分钟,消耗 Token 大约在 1500 万左右。</p><p>可以说,至少在我们的这轮测试里,GLM-5.3-Flash 和 GLM-5.3 的体验差距并没有价格差距 20 倍那么大。</p><p>注意力计算量、KV 缓存、激活参数和总参数可能已经发生了很大变化,但落到常规网页开发、研究报告等实际任务上,这些差异并不明显,GLM-5.3-Flash 也可以胜任。</p><p>Flash 正在越过斩杀线</p><p>同一晚发布的另一款 Flash 模型,也不“Flash”。</p><p>Qwen3.8-Flash 主模型 125B 参数,外加 51B 的 N-gram Embedding,每 token 只激活 6B 参数;原生支持 26.2 万 token 上下文,可通过 YaRN(Yet another RoPE extensioN)扩展到 100 万。</p><p>更特别的是,它直接采用了下一代 Qwen4 的新架构。相比 Qwen3.7-Plus,通过架构和注意力机制内核的调整,整体训练成本降到约九分之一,编码和办公任务反而更强。</p><p><img decoding=\"async\" loading=\"lazy\" src=\"https://x0.ifengimg.com/res/2026/833E5167A8C77B3633F1F340D9332D9BD81E165C_size240_w1080_h1097.png\"/></p><p>前段时间,我们在《DeepSeek 给大模型划出的“斩杀线”,斩的到底是什么》里给“斩杀线”下过一个定义:足够高的任务完成率 × 足够低的总任务成本,从而夺走默认调用位。</p><p>当时看这似乎是 DeepSeek 的单点优势,毕竟一直以来的印象,卷价格,没有人能做到比 DeepSeek 低,智能水平,DeepSeek 也并不会让人失望。</p><p>随着智谱发布价格更低的 GLM-5.3-Flash,千问也发布未来结构、价格同样便宜的 Qwen3.8 Flash,所谓的斩杀线已经不再是 DeepSeek 这一家模型厂商的叙事,更像是整个做大模型行业的新规则。</p><p><img decoding=\"async\" loading=\"lazy\" src=\"https://x0.ifengimg.com/res/2026/0B36769CE70CB4EA33C83D8EAF6D7E585C47F3E4_size191_w1080_h720.png\"/></p><p>根据 Artificial Analysis 的测算结果,GLM-5.3-Flash 单次任务的成本比 DeepSeek V4 Flash 低,且智能水平要比 V4 Flash 和 V4 Pro 都要高。</p><p>当百万上下文、原生多模态和 Coding Agent 开始成为标配,模型厂商正在做同一件事:把过去接近旗舰级的能力,压进 Flash 的价格带。</p><p><img decoding=\"async\" loading=\"lazy\" src=\"https://x0.ifengimg.com/res/2026/24C1BBDF885962EA2C9776824742AB0A5CE5B194_size171_w1080_h536.png\"/></p><p>图|最近一个月发布的 Flash 模型情况</p><p>有意思的是,从今年 2 月发布 Gemini 3.1 Pro 之后,Google 就再没发过任何 Pro 模型。他们在五月发布 Gemini 3.5 Flash、七月发布 Gemini 3.6 Flash、八月发布 Gemini 3.7 Flash……</p><p>现在看来,原来 Google 一直发布 Flash 是看中了这块斩杀线。</p><p><img decoding=\"async\" loading=\"lazy\" src=\"https://x0.ifengimg.com/res/2026/35EC98094DE5EF90EAB8BCB1946CAD3C52E8F8FF_size79_w1080_h248.png\"/></p><p>过去的 Flash 依靠削减能力,比如缩减上下文、剥离多模态来换取低价,匹配对应的市场;而现在的 Flash 保持功能全量,仅通过极低的高效激活参数,像是百亿级激活/几百亿总参数,来压缩单 Token 边际成本。</p><p>在眼下“无处不消耗 Token”的背景下,让更多的用户可以大胆地在后台运行着一个自己的“全天候 Agent”,或工作中小到转换图片格式、文档格式这样的工作,都能直接丢给 AI。</p><p><img decoding=\"async\" loading=\"lazy\" src=\"https://x0.ifengimg.com/res/2026/03CA64B048300D603DA1060229875168100EFEBF_size170_w1080_h562.png\"/></p><p>而更昂贵的旗舰模型,在更多的时候则是退到了非选不可的情况,只有我们在触发到任务困难、Flash 做不好的情况,或者让 Pro 决策,用 Flash 执行等。</p><p>另一方面,Flash 带来的变化也在模型迭代路径上体现,过去是“旗舰先发 $ightarrow$ 蒸馏缩小 $ightarrow$ 推出 Flash”;现在则演变为“高效架构(如新型 MoE、预测草稿 Token)先在 Flash 验证 $ightarrow$ 再拓展至旗舰”。</p><p>效率工程本身成为了行业的最前沿,Flash 架构的创新密度甚至开始超越旗舰。</p><p><img decoding=\"async\" loading=\"lazy\" src=\"https://x0.ifengimg.com/res/2026/9D88EA66EFBB6801D0B7D6398ED220072E72E021_size866_w867_h1083.png\"/></p><p>所以今天再问什么是 Flash,答案已经变了。以前,它意味着更快、更便宜的轻量模型;现在,它代表的是足够高的任务完成率,以及足够低的任务成本。</p><p>哪怕生成速度只有 50 Token/s,只要它拥有视觉自检与长文本推理能力,能稳妥跑完耗时 10 分钟的复杂 Coding 或办公工作流,它在商业层面就已经斩断了传统低端模型的生存空间。</p><p>过去,我们总想默认使用“最聪明的模型”。接下来,默认调用位可能属于那个足够聪明、足够便宜,因此可以放心一直开着的模型。</p><p>这是 Flash 越过斩杀线之后带来的变化,旗舰模型决定 AI 的上限,而 Flash 决定我们每天到底用哪个 AI。</p></body></html>","source":"fenghuang_stock","collect":0,"html":"<!DOCTYPE html>\n<html>\n<head>\n<meta http-equiv=\"Content-Type\" content=\"text/html; charset=utf-8\" />\n<meta name=\"viewport\" content=\"width=device-width,initial-scale=1.0,minimum-scale=1.0,maximum-scale=1.0,user-scalable=no\"/>\n<meta name=\"format-detection\" content=\"telephone=no,email=no,address=no\" />\n<title>DeepSeek的斩杀线一夜被斩杀,便宜大碗才是真旗舰</title>\n<style type=\"text/css\">\na,abbr,acronym,address,applet,article,aside,audio,b,big,blockquote,body,canvas,caption,center,cite,code,dd,del,details,dfn,div,dl,dt,\nem,embed,fieldset,figcaption,figure,footer,form,h1,h2,h3,h4,h5,h6,header,hgroup,html,i,iframe,img,ins,kbd,label,legend,li,mark,menu,nav,\nobject,ol,output,p,pre,q,ruby,s,samp,section,small,span,strike,strong,sub,summary,sup,table,tbody,td,tfoot,th,thead,time,tr,tt,u,ul,var,video{ font:inherit;margin:0;padding:0;vertical-align:baseline;border:0 }\nbody{ font-size:16px; line-height:1.5; color:#999; background:transparent; }\n.wrapper{ overflow:hidden;word-break:break-all;padding:10px; }\nh1,h2{ font-weight:normal; line-height:1.35; margin-bottom:.6em; }\nh3,h4,h5,h6{ line-height:1.35; margin-bottom:1em; }\nh1{ font-size:24px; }\nh2{ font-size:20px; }\nh3{ font-size:18px; }\nh4{ font-size:16px; }\nh5{ font-size:14px; }\nh6{ font-size:12px; }\np,ul,ol,blockquote,dl,table{ margin:1.2em 0; }\nul,ol{ margin-left:2em; }\nul{ list-style:disc; }\nol{ list-style:decimal; }\nli,li p{ margin:10px 0;}\nimg{ max-width:100%;display:block;margin:0 auto 1em; }\nblockquote{ color:#B5B2B1; border-left:3px solid #aaa; padding:1em; }\nstrong,b{font-weight:bold;}\nem,i{font-style:italic;}\ntable{ width:100%;border-collapse:collapse;border-spacing:1px;margin:1em 0;font-size:.9em; }\nth,td{ padding:5px;text-align:left;border:1px solid #aaa; }\nth{ font-weight:bold;background:#5d5d5d; }\n.symbol-link{font-weight:bold;}\n/* header{ border-bottom:1px solid #494756; } */\n.title{ margin:0 0 8px;line-height:1.3;color:#ddd; }\n.meta {color:#5e5c6d;font-size:13px;margin:0 0 .5em; }\na{text-decoration:none; color:#2a4b87;}\n.meta .head { display: inline-block; overflow: hidden}\n.head .h-thumb { width: 30px; height: 30px; margin: 0; padding: 0; border-radius: 50%; float: left;}\n.head .h-content { margin: 0; padding: 0 0 0 9px; float: left;}\n.head .h-name {font-size: 13px; color: #eee; margin: 0;}\n.head .h-time {font-size: 11px; color: #7E829C; margin: 0;line-height: 11px;}\n.small {font-size: 12.5px; display: inline-block; transform: scale(0.9); -webkit-transform: scale(0.9); transform-origin: left; -webkit-transform-origin: left;}\n.smaller {font-size: 12.5px; display: inline-block; transform: scale(0.8); -webkit-transform: scale(0.8); transform-origin: left; -webkit-transform-origin: left;}\n.bt-text {font-size: 12px;margin: 1.5em 0 0 0}\n.bt-text p {margin: 0}\n</style>\n</head>\n<body>\n<div class=\"wrapper\">\n<header>\n<h2 class=\"title\">\nDeepSeek的斩杀线一夜被斩杀,便宜大碗才是真旗舰\n</h2>\n\n<h4 class=\"meta\">\n\n\n2026-08-28 00:01 北京时间 <a href=https://tech.ifeng.com/c/8vvgqvFRDWv><strong>爱范儿</strong></a>\n\n\n</h4>\n\n</header>\n<article>\n<div>\n<p>刷屏快一周的匿名模型“牛来”,正式揭晓了真身。8 月 26 日晚,智谱正式上线并开源了 GLM-5.3 Flash,确认它就是 8 月 20 日起以 Ox-Alpha 代号,在大模型聚合平台 OpenRouter 和 OpenCode 上匿名测试的那个模型。说起来,这是智谱第二次用这种匿名模型先免费跑一周赚流量,然后再官宣认领,上次是“马来”。春节前夕的 Pony-Alpha,后来被证明是 GLM...</p>\n\n<a href=\"https://tech.ifeng.com/c/8vvgqvFRDWv\">网页链接</a>\n\n</div>\n\n\n</article>\n</div>\n</body>\n</html>\n","type":0,"thumbnail":"","relate_stocks":{"02513":"智谱","LU0593848301.USD":"未来资产亚洲卓越消费股票基金A","BK1117":"系统软件"},"source_url":"https://tech.ifeng.com/c/8vvgqvFRDWv","is_english":false,"share_image_url":"https://static.laohu8.com/e9f99090a1c2ed51c021029395664489","article_id":"2662034957","content_text":"刷屏快一周的匿名模型“牛来”,正式揭晓了真身。8 月 26 日晚,智谱正式上线并开源了 GLM-5.3 Flash,确认它就是 8 月 20 日起以 Ox-Alpha 代号,在大模型聚合平台 OpenRouter 和 OpenCode 上匿名测试的那个模型。说起来,这是智谱第二次用这种匿名模型先免费跑一周赚流量,然后再官宣认领,上次是“马来”。春节前夕的 Pony-Alpha,后来被证明是 GLM-5。就在同一晚,阿里也发布了一款新模型,且一样是 Flash 款。Qwen3.8-Flash 正式在大模型开源平台 Hugging Face,和阿里的模型开源社区魔搭 ModelScope 开源权重。特别的是,千问这款新模型,虽然是 Flash,但是却作为 Qwen4 架构的早期预览版,用的是下一代 Qwen4 模型的新架构。架构之外,两个新模型的 benchmark 数据和具体表现,也一点不像是原本我们对 Flash 的印象,即旗舰/Pro 模型的删减版。GLM-5.3-Flash 拥有百万上下文,也是 GLM-5 系列的第一个原生多模态模型,图片、视频、文件、Coding,以及 Computer Use 这些功能现在全部靠模型就能做到。Qwen3.8-Flash 同样保留百万上下文、图像和视频输入,结合千问办公,生成速度提升 100%,Token 消耗减少 75%。图|GLM-5.3 Flash 在多个 benchmark 上的表现基本在 Opus 4.8 的水平与此同时,极致性价比和普惠是这两款模型的定位。GLM-5.3-Flash 的定价前所未有,限时折扣内每百万 Token 输入是 0.4 元,输出 1.4 元,缓存命中 0.115 元,是 GLM-5.3 的 1/20。Qwen3.8-Flash 的价格同样感人,每百万 Tokens 输入仅 1 元、输出 3 元,是 Qwen3.8-Max 的 1/12。作为对比,现阶段涨价后的 DeepSeek V4 Flash 价格是每百万 Token 输入是 1.5 元,输出 4.5 元,缓存命中 0.05 元,而高峰时段还是空闲时段的两倍。目前高峰时段为北京时间周一至周五 9:00 - 12:00、14:00 - 18:00,其余为空闲时段。一边要比较模型界的“拼多多”DeepSeek V4 Flash 的价格,一边又要比较智能上限,动不动就对标 Claude Opus 5、Fable 5 等。图|DeepSeek V4 系列模型价格,从左至右为 V4 Flash、V4 Pro、V4 Flash Vision 实验版Flash 似乎正在摆脱过去“砍参数、砍多模态、砍上下文”换低价的定位,从一句“够用就好”,变成大模型厂商新的竞争重点。和 Opus 4.8 得分持平OpenCode 的界面仍然显示着,ox-alpha 有 50.5 万个独立用户标识,累计消耗 Token 达到了 44T,完成超过 1300 万个会话,输入 Token 的缓存比例达到 93%。这些数字能证明大量调用发生在 Coding Agent 平台,即便是匿名身份也没有阻挡住开发者对这款新模型的使用热情。持续的调用,让这个“牛来”模型终结了 DeepSeek 在 OpenCode 上长达 56 天的霸榜。而来自模型调用的算力压力,智谱后续则提到,这些请求流量全部由国产芯片提供算力支持,他们调用了超过 10 万张国产芯片做推理服务,并在技术文档中表示其集群“硬件效率及单位 token 成本已经达到了与主流英伟达 GPU 相当的水平”。我们简单测试了一下 GLM-5.3-Flash 的能力,目前它在智谱官方的 Coding Agent 平台 ZCode 上可以直接体验。官方平台的 BigModel、Coding Plan 等 API 接入也已经开启调用。多模态的视觉能力是 GLM-5.3-Flash 的新增能力,我们上传了 X 上最近比较火的二维码项目视频。平视是一棵树,但是当我们拖拽鼠标切换不同视角,俯视时,这棵像素块组成的树就变成了一个可扫描的二维码。GLM-5.3-Flash 可以自动读取视频,但工作时间和我们之前的测试一样,ZCode 要花较长的时间进行思考。似乎并没有因为模型是 Flash,而导致任务的执行时间有变短。最终实现的项目也是可以用的,但是如动图所示,整个网页非常卡顿。我们要求 GLM-5.3-Flash 分析卡顿原因,它自己也提到,之前的实现每一帧都要重新绘制整个场景。而整个场景有将近 1300 块地砖,每块最多 5 个面(顶面 + 4 面墙),再加投影计算里每点都算一遍三角函数,鼠标拖拽的每帧,就有约 6000 次路径填充、2 万次三角函数,60fps 下非常吃力。修复之后的版本要好上不少,动画更加丝滑,拖拽也不卡顿,切换主题样式时渲染都更快。而整个项目从读取视频,到实现这个 3D 效果的二维码网页,以及二次修改;ZCode 内显示的应用用量消耗是将近 3000 万 Token,个人套餐内的 5h 剩余额度还有 98%,每周额度则是剩余 99%。我们继续使用 GLM-5.3-Flash 进行测试,模型的多模态能力很好地帮助 ZCode 可以持续截图,通过视觉识别自身生成的内容,以及用“试玩”等方式来找到输出结果中不合理的部分。同样是之前在 X 上比较热门的中国宝塔案例,模型需要使用 3D 库, 生成一座中国宝塔,朱漆绿釉,顶部饰以鎏金的完整搭建过程。GLM-5.3-Flash 似乎参考了二维码花园的项目,导致这个中国宝塔也采用了和之前一样的像素风格,整个用时 57 分钟,消耗 Token 大约在 1500 万左右。可以说,至少在我们的这轮测试里,GLM-5.3-Flash 和 GLM-5.3 的体验差距并没有价格差距 20 倍那么大。注意力计算量、KV 缓存、激活参数和总参数可能已经发生了很大变化,但落到常规网页开发、研究报告等实际任务上,这些差异并不明显,GLM-5.3-Flash 也可以胜任。Flash 正在越过斩杀线同一晚发布的另一款 Flash 模型,也不“Flash”。Qwen3.8-Flash 主模型 125B 参数,外加 51B 的 N-gram Embedding,每 token 只激活 6B 参数;原生支持 26.2 万 token 上下文,可通过 YaRN(Yet another RoPE extensioN)扩展到 100 万。更特别的是,它直接采用了下一代 Qwen4 的新架构。相比 Qwen3.7-Plus,通过架构和注意力机制内核的调整,整体训练成本降到约九分之一,编码和办公任务反而更强。前段时间,我们在《DeepSeek 给大模型划出的“斩杀线”,斩的到底是什么》里给“斩杀线”下过一个定义:足够高的任务完成率 × 足够低的总任务成本,从而夺走默认调用位。当时看这似乎是 DeepSeek 的单点优势,毕竟一直以来的印象,卷价格,没有人能做到比 DeepSeek 低,智能水平,DeepSeek 也并不会让人失望。随着智谱发布价格更低的 GLM-5.3-Flash,千问也发布未来结构、价格同样便宜的 Qwen3.8 Flash,所谓的斩杀线已经不再是 DeepSeek 这一家模型厂商的叙事,更像是整个做大模型行业的新规则。根据 Artificial Analysis 的测算结果,GLM-5.3-Flash 单次任务的成本比 DeepSeek V4 Flash 低,且智能水平要比 V4 Flash 和 V4 Pro 都要高。当百万上下文、原生多模态和 Coding Agent 开始成为标配,模型厂商正在做同一件事:把过去接近旗舰级的能力,压进 Flash 的价格带。图|最近一个月发布的 Flash 模型情况有意思的是,从今年 2 月发布 Gemini 3.1 Pro 之后,Google 就再没发过任何 Pro 模型。他们在五月发布 Gemini 3.5 Flash、七月发布 Gemini 3.6 Flash、八月发布 Gemini 3.7 Flash……现在看来,原来 Google 一直发布 Flash 是看中了这块斩杀线。过去的 Flash 依靠削减能力,比如缩减上下文、剥离多模态来换取低价,匹配对应的市场;而现在的 Flash 保持功能全量,仅通过极低的高效激活参数,像是百亿级激活/几百亿总参数,来压缩单 Token 边际成本。在眼下“无处不消耗 Token”的背景下,让更多的用户可以大胆地在后台运行着一个自己的“全天候 Agent”,或工作中小到转换图片格式、文档格式这样的工作,都能直接丢给 AI。而更昂贵的旗舰模型,在更多的时候则是退到了非选不可的情况,只有我们在触发到任务困难、Flash 做不好的情况,或者让 Pro 决策,用 Flash 执行等。另一方面,Flash 带来的变化也在模型迭代路径上体现,过去是“旗舰先发 $ightarrow$ 蒸馏缩小 $ightarrow$ 推出 Flash”;现在则演变为“高效架构(如新型 MoE、预测草稿 Token)先在 Flash 验证 $ightarrow$ 再拓展至旗舰”。效率工程本身成为了行业的最前沿,Flash 架构的创新密度甚至开始超越旗舰。所以今天再问什么是 Flash,答案已经变了。以前,它意味着更快、更便宜的轻量模型;现在,它代表的是足够高的任务完成率,以及足够低的任务成本。哪怕生成速度只有 50 Token/s,只要它拥有视觉自检与长文本推理能力,能稳妥跑完耗时 10 分钟的复杂 Coding 或办公工作流,它在商业层面就已经斩断了传统低端模型的生存空间。过去,我们总想默认使用“最聪明的模型”。接下来,默认调用位可能属于那个足够聪明、足够便宜,因此可以放心一直开着的模型。这是 Flash 越过斩杀线之后带来的变化,旗舰模型决定 AI 的上限,而 Flash 决定我们每天到底用哪个 AI。","news_type":1,"symbols_score_info":{"02513":0.86}},"isVote":1,"tweetType":1,"viewCount":14,"commentLimit":10,"likeStatus":false,"favoriteStatus":false,"reportStatus":false,"symbols":[],"verified":2,"subType":0,"readableState":1,"langContent":"CN","currentLanguage":"CN","warmUpFlag":false,"orderFlag":false,"shareable":true,"causeOfNotShareable":"","featuresForAnalytics":[],"commentAndTweetFlag":false,"andRepostAutoSelectedFlag":false,"upFlag":false,"length":21,"optionInvolvedFlag":false,"subscribersOnly":false,"subscribersOnlyAccessible":false,"xxTargetLangEnum":"ZH_CN"},"commentList":[],"isCommentEnd":true,"isTiger":false,"isWeiXinMini":false,"url":"/m/post/602536490824696"}
精彩评论