Grok 4.6 上手数周的真实感受:信息密度极高的沟通、令人愉悦的速度,以及那句让结果天差地别的验证指令。
Grok 4.6 发布了!这几周我一直在拿它当主力模型,应付我日常那套编码和知识工作的活儿,还特意做了几个项目,专门去压一压它的上限到底在哪。
它每一块都做得不错。但最打动我的,是它沟通的方式和它的速度——这比任何单点的能力跃升都更让我印象深刻。
【嵌入推文 · SpaceXAI】「隆重推出 Grok 4.6。它带来前沿智能,在同等价格下比 Grok 4.5 有了显著提升。」
信息密度极高的沟通
它那种协作方式,让人很容易和它并肩干活。它给出的总结里塞满了实实在在的信息,从不把我交给它的任务原样复述回来;它运行过程中的简短进度更新,也足以让我判断要不要打断它。
小改动时它安安静静,一旦要动很多文件它才开始一步步说明。把这条分界线调对,比你想的要费劲得多。它有时还是会告诉我一些我并不需要知道的事——这点我们还在改进。
令人愉悦的速度
4.5 也很快。4.6 既快又明显更聪明,这两点加在一起,把我推向了一种更同步的工作方式。与其一次性塞进一大堆上下文然后干等,我现在是要一件小事,看一眼,然后继续往下走。同一个会话,只要开口要,就能自然切换到更长远期的任务上。
我会根据当月最强的那批模型擅长什么,在同步和异步之间来回切换。异步能在我人不在的时候完成更多事,但我会丢掉思路,最后只能冷启动地去 review 一大坨 diff。4.6 把我拉回了同步——在我真正在乎结果的时候,同步才是我想要的。
我还做了 Cursor SDK Bridge 和 /rename-chat 这两个小工具,并用 Remotion 给它们俩做了发布视频!不过这几周大多数时候还是些普通的活儿。它帮我浏览网站,包括点进服务商的控制台一步步帮我创建 API key。它在运行中的应用上做功能和视觉层面的 QA。它把我的收件箱清理到只剩真正需要回复的那几封,那种感觉每次都很爽。它还帮我起草了 Cursor SDK Bridge 和 /rename-chat 的发布文案。
短提示词,严格验证
那几周里,我花了一部分时间拿不同的提示词风格互相对照。长提示词对短提示词,还有「用尽全力」这类具体措辞到底会不会改变结果。我的发现是:措辞几乎不影响结果。
长度倒是影响,不过不是我以为的那种方式。长提示词买到的是「具体性」,所以如果你清楚知道自己要什么,就把它写下来。短提示词则把更多的决定权交给模型的品味。过去这种权衡会倾向于让你把一切都写出来。但到了 4.6,它的品味已经足够好,一个短提示词加上一句明确的偏好,通常就能落到一个不错的结果上。
我给它一份关于一个 feedback widget 的详细规格——带会话捕获、一个服务端处理器,还有云端 agent 分发——它从头到尾都跟了下来,结构也很合理。不过它会在组件里重复自己,除非你要求它把组件拆开。当你手头有详细规格时,长规格依然好用。
我做的项目里有一个是电子表格应用,我把同样的需求分别给了两个模型两次。一次拿到的是两页规格,覆盖了我想得到的每一个工具栏项、快捷键和公式。另一次只给了三句话。
用 Next.js 做一个精致的 Sheets/Excel 风格应用,再加一个能分析表格的 AI 聊天。所有 AI 功能都用 Cursor SDK。预加载一个逼真的示例工作簿,让它一打开就好看。
两个应用做出来几乎一模一样。真正改变结果的,是加了一句话:
实现之后,验证功能和设计,然后不停地迭代和验证,直到它达到生产可用。
那一句话,是我那几周里找到的杠杆最大的一件事!有了它,模型会打开应用,沿着真实用户路径点一遍,检查嵌套公式能不能正确求值,然后把发现的问题修掉。而这些没有扎实的浏览器操作能力是做不到的——正是这种能力让整个闭环成为可能。
当输出更难检查时,同样的原则依然成立。对一个 3D 场景说「把纹理做好一点」毫无进展,而说「捕获当前帧,列出它哪里不对,然后只修这些问题」立刻就见效了。
从这里往后的每一次对比,都是把同一条提示词在隔离的工作区里分别喂给两个模型,所以没有任何一条来自我的「上个月记忆」。
你也不需要告诉它「努力干」或「一直干到做完为止」。它自己就会持续干上好一阵子。真正重要得多的是说清楚「怎样算做完」,否则它会替你做这个决定。
走得更远
我小时候玩 Age of Empires 2 玩得过分了,几千个小时。所以复刻它就成了我第一个想试的项目。我要求做一个浏览器策略游戏,带经济、建造、战斗、战争迷雾、目标,还有一个新手不用看说明也能看懂 HUD。
4.5 做出了一个能玩的平面原型。4.6 第一次尝试就交出了一个等距视角的 3D 世界,HUD 和小地图直接到位。跟真家伙接近多了!
还沉浸在这种怀旧情绪里,我接着做了 MSN Messenger。
两个模型显然都认得这个参照物,而且都做得不错。4.6 就是打磨得更精细,细到独立的对话窗口和眨眼表情都做出来了。
我天天用 Excalidraw,而且它是开源的,这就让它成了最顺理成章的实验场——看看模型面对一个真实代码库(而不是一个空文件夹)时表现如何。我要求两个模型都做一个「演示模式」:保存命名视图、给它们排序,然后把它们作为引导式走查来展示。提示词故意写得很模糊,不规定具体怎么实现。
两者大致落在同一个水准,对于一个这么模糊的提示词来说已经很惊人了!4.6 只是第一遍就更注意细节,实际效果就是我少了好几轮「指着它说这里不对」的来回。
这里也正是跳过验证会栽跟头的地方。早前有一次,summary 显示「已完成」,但新增视图其实没生效。一轮「跑起来给我看」就暴露了那个坏掉的 import。
日常工作
我不是每天都做 PPT 和报告,但很多人是,我就想看看它处理这类活儿怎么样。于是我给了两个模型同一份虚构的季度数据,让它们各做一份董事会演示文稿。
两个都胜任,真正的差距在呈现层面。4.5 基本上就是把数字铺在幻灯片上,而 4.6 真的在结构和层级上下了功夫,读起来像是一个人做的 deck,而不是一份数据倾倒。
把视频当代码
Remotion 就是「视频即代码」:每一帧都是一个 React 组件,根据当前帧号来渲染,整段再通过无头 Chromium 和 FFmpeg 编译成 MP4。你的视频就活在 git 里。这真的是一种很有趣的工作方式!不过把它交给模型也是个奇怪的选择,因为你没法通过「它能不能跑起来」来判断它做得好不好。这块值得多讲几句,因为我最近在这上面花了不少时间。
我要了一段 60 到 90 秒的发布影片,给 X 的 TypeScript SDK 用的,并把文档丢给它当素材。
我评判这些的标准是:有没有一条故事线,节奏撑不撑得住。大多数模型在这里栽的方式都一样——全大写标题、框起来的文字、所有东西一次性涌到屏幕上。这两段影片都避开了大部分坑,而 4.6 的那段更值得看。
跨不同模型跑了几天之后,视频是我看到差距拉得最大的领域。两个在做 Web 应用时感觉能力相当的模型,到了这里可能天差地别。
哪些地方需要你扶一把
我几乎所有需要出手干预的地方,都归结到同一件事:这个模型验证自己工作的能力有多强。
网站是最简单的情形。DOM 就是文本,所以它能读页面、截图,然后跟自己想要的效果对比。这正是验证闭环在 UI 工作上效果那么好的原因。
3D 就更难,因为有一整个维度是你靠「读」检查不了的。视频难上加难,因为时间是那个额外的维度,检查自己的活就意味着要捕获一帧帧画面,再去推演它们之间的差异。物理模拟也是同样形态的问题。模型对「世界该怎么运转」有不错的直觉,但「它是不是真的那样运转了」不是一张截图能回答的。
实际的做法是:给它一个「看」的途径,或者干脆接受「检查的人是你」。
为什么它成了我的默认选择
「尖峰模型」有它真正的价值——那些在某一件特定事情上超凡脱俗的模型。但我的工作大多不是某一件特定的事。我日常想要的是一个我熟悉的模型:一个我已经摸透了它的行为、可靠到能把事情交给它、并且清楚它短板在哪、能不加思考就绕开这些短板的模型。
这正是 4.6 对我来说变成的样子。编码这边,它能处理那些我需要边看边反应的交互和视觉活儿,也能在一个真实仓库里开长会话。知识工作这边,它管收件箱、做浏览器 QA、干那些没有 API 可调的点击式任务。在任意一件具体的事上,它都未必是想象中最强的那个模型,可它每一件都做得不错,而且我心里有数,知道该期待什么。
在那些最终要靠「看起来怎么样」来评判的产出上,我仍然会亲自参与。动效、3D 和最终打磨,需要的是一个参照物和一个截图闭环,而不是一段描述。而且我会把验收标准写下来,而不是去信一句「已完成」的总结。
试一试
Grok 4.6 现在已经在 Cursor、xAI API(在 OpenRouter 上)以及任何你能拿到 token 的地方上线了!
去试试,然后告诉我你的想法。我们会继续改进它,所以无论好坏,都请留下反馈——那正是告诉我们下一步该往哪推的信号。
很好奇你最终会拿它做出点什么来!
