Skip to content

第001期-看烟花

机械之手指向夜空烟花

烟花朵朵开,想法自然来。

看烟花!!!

天上掉下来的 400 刀

Meet Grok Bot

天上掉下来的 400 刀

收到了 Grok Heavy 的福利:一份价值 200 刀/月的 Cursor Ultra。

💡 接下来一个月,有 400 刀的 Fable 5 可以用了。不知道 K3 的消耗怎么样,也可以试试看。另外还有几乎不限量的 Grok 4.5。

Grok Bot QA engineer

Grok Bot 这个工具,我还没想好要怎么用。毕竟手头已经有 Hermes,而且我不用上班,天天都坐在电脑前面,似乎也不太用得上它。

Opus 5 usage log

刚刚它搜索了我的 GitHub 仓库,竟然用的是 Opus 5 模型。

我问了一下,它说自己和 Cursor 共用付费池。但我刚刚查看 Cursor,里面并没有计算这笔费用。另外,默认模型也没有标出具体使用的是哪个模型。毕竟还是刚推出的新产品,很多打磨应该才刚开始吧。

Cursor usage

Grok Bot 真的能成为一个独立的付费产品吗?我保持怀疑。如果它完全和 Cursor 绑定,那以后 Cursor 的套餐定位该怎么计算呢?

Grok Bot 是准备长期与 Cursor 套餐绑定,还是准备让三个应用共用一个套餐池呢?

💡 单看性价比,300 美元/月的 Grok Heavy 套餐并不算高。有人算过,它大概相当于 7.5 倍 30 美元/月 Grok 套餐的 Grok 4.5 用量,性价比低于 200 美元/月的 GPT Pro。当然,如果把视频生成和 X 账户权益也算上,可能就差不多了。

如果 300 美元/月的 Grok Heavy 套餐能附带价值 100 美元/月的 Cursor 套餐、价值 100 美元/月的 Grok Bot,再加上相当于 7.5 个 Grok Build 账号的 Grok 模型用量,那应该会更有吸引力吧。

蛋白粉好贵哇

iHerb 上 1000g 均价大概在 400 左右了

京东京造分离乳清蛋白粉

闲鱼 180 元/桶买的京东京造分离乳清:

京东京造花生可可味分离乳清蛋白粉

京东分离乳清喝完了,再买发现涨价了。现在要 280 元/桶(817g),性价比就不高了。

听说这两年因为司美格鲁肽,很多减肥的美国人有嗑蛋白粉的需求,特别是分离乳清蛋白粉价格暴涨。

这款新包装的也要 280 元/1000g:

MyProtein 分离乳清新包装

老包装的便宜:

MyProtein 分离乳清老包装

闲鱼、淘宝、京东价格大概在 110–180 元不等。查了下,新老包装换代是在 2024 年。蛋白粉保质期是 2 年。正常来说,老包装多半是临期货;但淘宝和京东上很多保质期还是新的,这就不正常了。就因为包装不同,粉都是一样的粉,价格却差了一倍多。

反倒是闲鱼,有那种保质期到 12 月的;京东有一家保质期是到 27 年 3 月的。我决定先从闲鱼买那款保质期到今年 12 月的——反正 1000g 大概也就一个多月就消耗了。

后续可能考虑上汤臣倍健旗下的这款,500 元/1810g。这种一般不会有假冒的,不过还是希望闲鱼后面京东那款能价格降下来。

汤臣倍健健乐多分离乳清

李继刚的 /ljg-classic

水墨山水意境图

李继刚新写的 skill:/ljg-classic,用来辅助阅读古文,效果很不错。

这是《道德经》第一章,我用 Grok 生成的:

《道德经》第一章 /ljg-classic 解读

Trae 这条路在自研模型没成果前,不好走

TRAE 官网首页

刚刚想尝试下字节的 Trae Work,原因是听说 Trae 竟然在分众的电梯上打广告了。

免费版本的限制比较多,最便宜的 V4 Flash 简单的问题也要排队:

Trae 免费版可选模型与倍率

Trae Work 排队提醒

看得出团队是有花心思去打磨的。问题是,当前 harness 的高体验在 Codex、Cursor、Claude Code。花活再多,模型端没优势,难有效果。

TRAE 订阅计划

在给新用户的体验上也不愿意给足羊毛。(我并不认为当前阶段给足羊毛会有效果,但不给足羊毛,新客户甚至连试都不愿意试。)核心还是差异化做不出来。市面上通行的 Work 产品、coding 产品,体验上最大的差距还是模型和通用能力。字节在 coding 和办公这条路上,短期很难有成果,腾讯和阿里也一样。

Grok 4.6 和 DeepSeek 4 Pro 正式版

2026年08月13日上线

马斯克推文:SpaceXAI Colossus 2 正在训练七个模型

Grok 4.5 上线的那一天我就感慨过,全民 Opus 4.8 的时代不远了。这款模型几乎跨越了不可能三角:便宜、速度、好用。Fable 5 出来,起了一个不好的头——堆参数、烧硬件、力大飞砖,导致模型又慢又贵。GLM 5.2 早期版本和 K3,都算是路子走到了慢和贵的叉路上。

马斯克不缺卡、不缺算力,他为什么到 Grok 4.7 才上 2T 规模参数,我不得而知。我猜应该和 Cursor 对模型在代码真实场景下的应用理解有关系。Grok 4.5 以 1.5T 做到这样的效果,加上最新的 4.6 在跑分上已经对齐 Opus 5,600 亿的 Cursor 真不亏。它和 DeepSeek V4 Flash 很好地扭转了被 Fable 5 带偏的模型道路。

A 社最近从 Opus 4.8 到 Sonnet 5,不仅没有惊艳感,甚至处于好用与不好用之间的临界状态。Haiku 更是很久没声音了。想想曾经被 Sonnet 3.5 支配的恐惧吧——那个说话好听、还能干活的唯一选择。A 社的黄金时代已经过去了。而 O 社则很好地跟住了节奏。不得不说,GPT 在这两年大模型的竞争中从来没落下。

今天的 DeepSeek 4 Pro,跑分虽然不差 Grok 4.6,但速度更慢,从任务完成效率上看,大致是输 Grok 不少的。在同等参数模型的前提下,DeepSeek 4 Pro 的价格要做更多考量了。

DeepSeek 官网:V4-Flash 正式版 API 公测,V4-Pro 暂未变动

V4-Pro 上线不久就下线了,估计调试遇到问题。

妈的,昨天老马给我惊喜,送了一个月的 Cursor,今天就把包年的 Grok Heavy 封了。包年账号被封:3 个普通、1 个 Heavy。肉疼啊。后续如果没有更好的入手渠道,可能要转向买 OpenCode 了。或者正价买一个普通 Grok 账号?

Grok Bot:非常有意思的产品

Grok Bot:非常有意思的产品

在即时信息的检索和分析上,这种用群对话的方式来分派任务,有种指挥作战的爽感。应用形态上没有问题,界面很舒服,是一种独立于其他应用的呈现。

关键是,在指挥的时候并不需要考虑提示词,也不需要考虑工具调用,这些都由 Bot 自己解决。

这个方向应该是能通的。

但这个方向对模型能力的要求应该没那么高,大厂复刻起来应该也不会非常难。真正贵的是给 Agent 一个完美的执行空间。Mac mini 还是 Linux 才是更好的选择呢?

Hermes 是否能抓住这波机会,从一个更偏向玩具的 Harness 走向真正的办公应用场景?

WorkerBuddy 形态上是弱于 Grok Bot 的。反倒是 Marvis 更偏向这个形态,可惜做得不好,估计在硬件投入和配置上也没老马那么坚决。

一个月后,300 刀/月,配上 200 刀的 Cursor、200 刀的 Grok Build、Grok Bot 以及很多福利,不能不说性价比不低。但问题是,真的太贵了,当前普通玩家使用 AI 的投入产出比很难达到这样的要求。100 刀/月,还真可以考虑。

Grok Bot 非常有意思的产品

DeepTutor 知识问答harness

DeepTutor 知识问答harness

还在尝试,感觉比直接用普通的harness进行对话更有现场感。
用来进行投研资料的吸收,相对复杂内容的深入研究

DeepTutor

GLM 5.3 / Gemini 3.7 Flash / DeepSeek V4 Pro / Qwen 3.8 Max 27B

GLM 5.3 / Gemini 3.7 Flash / DeepSeek V4 Pro / Qwen 3.8 Max 27B

之所以又把 DeepSeek V4 拉上,在于大家对这款模型的评价极为模糊。
GLM 5.3 的前端广受好评,但后端逻辑还需要进一步观望。
Gemini 3.7 Flash 则在大家最爱的鹈鹕骑车测试中表现优秀,但其后端代码的执行能力还是只能说一般。
Qwen 3.8 Max 在大家的评测中同样处于模糊地带:前端受好评,而后端评价比较两极分化。
反而是最新的 27B,估计鹈鹕骑车做了指定训练,口碑反倒很好。

这么多模型在 L 站的评价分化,在我看来有几个共同前提:

  1. GPT 5.6 系列太均衡了。虽然前端一般,但其后端能力之强,让其他模型只能在跑分上追平,实际体验上的差距则是体感级别的。包括 Opus 5,性能和跑分确实已经超过 Sol 了,但在实际任务与执行中依旧有差距。

Fable 5 当然更强,但价格和使用门槛又阻挡了太多的人。GPT 当前的账号策略,在我看来是打了一场极大的翻身仗。如果一定要我取舍,只能选一个套餐,我当前的选择一定是 GPT,哪怕 Claude 不封号,我也会这样选。

当大家都用过 Sol 的时候,K3 也好、Qwen 3.8、GLM 5.3,还是 V4 Pro,在后端和代码逻辑上就都无法替代了。何况 Sol 当前的市场均价大概是 0.75 元人民币/M 输入、4.5 元人民币/M 输出。开源模型还有很长的路要走啊。

这反而是 worker buddy 们的机会,那些没有能力用上 GPT 的普通人。

  1. 谷歌选择上 3.7 Flash,DeepSeek V4 Pro 在实际体验中没办法和 Flash 拉开差距,在我看来则说明:短期在 coding 领域,属于普通人使用的大模型,也就是水煤电级别的模型,应该不会远了。最强的模型去解决最前沿的难题,而解决普通人的需求,模型可能需要的不再是宽度,而是深度。后训练可能又会变得很重要。

  2. GLM 5.3 依旧是 740B 的参数,应该算非常优秀的表现了。其真正的实力则需要进一步观察,等待其开源后,真实的价格可能才会凸显出来。

GLM5.3/Gemini 3.7Flash/DeepSeek v4 pro /qwen 3.8max 27B

当AI成为演技派

当AI成为演技派

这位博主精炼了一份提示词,把人物的微表情呈现得极为细腻。
当解决一致性问题
当解决生成时长问题
当解决 token 昂贵问题
平台会重新变得重要
生态会重新变得重要
内容制作会重新变得重要
应用,会重新变得重要
但,人,有可能没那么重要

当AI成为演技派

关于DeepSeek Harness

关于DeepSeek Harness

我理解的DeepSeek Harness万物皆插件,其野心不在于当前,在模型能力以及价格皆被约束的当下,插件的制造成本极高,消耗时间 精力和token。
但。当模型能力进一步提升,模型给harness制造插件和当前写个程序一样简单的时候。这套体系才真的暴露出其实战能力。这套系统本质上是为未来的agent准备的。
梁子在那场电话问答会上讲的很清楚,追求的是自进化的智能体。
mcp skill 本质上都是围绕程序+说明书的插件,而插件是这二者共同的后缀。
ai写mcp 写skill往往还是给人写的,或者说半人半AI写的,未来当需求足够的模糊,足够的大,足够的复杂。插件会被随意的写出来又随意的丢弃。
为什么是web端?因为他足够的好修改,改好刷新就立马上线了,cli tui当然好,但呈现的不够明显,而且重置依旧麻烦,其他的架构就更是这样。
我不知道DSH能不能成,但其可玩性,可学性是值得的。

Fitbit Air/Polar Loop/WHOOP/

Fitbit Air 手环深度体验:「无屏」只是手段,模型能力才是护城河

Fitbit Air/Polar Loop/WHOOP/

我带华为手环3年了,除了运动看看心率,睡醒看看睡眠质量,用处并不大,回看最大的遗憾是数据采集的缺失。我应该选苹果手表的。身体数据采集其实非常重要。我们的个人健康数据,在未来会成为我们生存重要的上下文。

现在在等待,在考虑是选苹果手表还是无屏手环。以及当前的设备还不能准确的检测血糖这是比较遗憾的事情。我会认为当前阶段,硬件上谁能采集到的身体数据更多,更准确,比其他功能都重要。订阅制在当前强大的大模型下不是可长久的生意,GPT已经可以分析苹果手表的历史数据了,这时候期望依赖订阅制盈利我不看好。

引用标题文章中的一句话:智能手表的逻辑是「人在使用设备」,Fitbit Air 的逻辑更接近「AI 通过这样一台现实设备在观察人」。

GLM5.3 700b跑出了K3 2T的效果。这是否意味着佳明等专业运动厂商基于这样的开源模型训练属于自己的模型会越来越简单,如果梁文锋追求的自训练模型,自迭代模型真的能落地,那属于家庭的专属模型是否真的能成为现实?这些模型的数据语料上下文来源是我们的心率 我们的饮食 我们的血氧 血糖 我们的基因 我们的日常数据存在。

模型能力的燃料是否可能从“公开文本”换仓到“私有传感流”。生理数据对通用预训练不好用,不是缺陷,是形态不匹配——时序传感信号对不上文本 token 的口径,通用大厂既拿不到它、也消化不了它;能冶炼它的只有“传感 + 信任 + 端侧算力”三件齐全的角色。

Fitbit Air/Polar Loop/WHOOP/

Fitbit Air/Polar Loop/WHOOP/

1亿token GLM5.3 初步体验

opencode 用量排名,GLM5.3抬升的很快,应该会超过k3

1亿token GLM5.3 初步体验

智谱今天送了1亿token给新用户,进行了体验,效果不错。个人体感是,max强度下,速度比grok 4.6 xhigh 慢,任务达成度则比grok 4.6好。(比较的是cursor里的256k阉割版本。)
价格合适的话,GLM5.3+sol 会是不错的搭档,前端和执行交给glm 而规划和审核交给sol,GLM的规划能力还没深度体验,也许也不错。不过总体性价比依旧是GPT最高,毕竟当前质保月抛价格大概在60-80之间。大概是对齐20x的价格的。
GLM5.3在两周后开源,当前阶段第三方的价格还比较贵。
如果opencode在开源后GLM5.3对齐5.2。一个20-30元/月的套餐 8倍k3的用量,还是可以一试的。
不过最近codex进行了高频的更新,体验又有提升。国模进步很快,GPT进击也很快,A社呢?

1亿token GLM5.3 初步体验

个人笔记分享 · 非投资建议,据此决策风险自负

闽ICP备2026032381号-1