最近整理博客的分类和标签,顺手翻到两年前写的两篇 Cursor开发工具初探(1)、(2),还有同一时间的 本地部署AI模型的方式方法。那时候觉得 AI 已经很厉害了,主要是帮我写代码。
两年过去,回头一数,AI 碰到的地方早就不止写代码了:本地 AI 部署、3D 和视频、翻译、自己用的媒体库和阅读器、小游戏、博客、备份、家里的机器……不知不觉就织进了日常。趁着还记得,稍微整理一下。
先说一句:下面提到的,只是这两年跟 AI 一起折腾过的十之一二,挑几个印象深的随便写写。

一,2024:编辑器里的助手
两年前的主角是 Cursor。那时我对 Chat 功能的描述是:
有时,它就像一个同事,能够与我讨论解决方案和实现思路;
有时,它又像一个高效的助手,协助我完成一些琐碎的工作。
印象最深的是 CursorTab 补全,“像肚子里的蛔虫一样”,刚有个念头它就把整段代码补出来了。同一时间还折腾了本地的 Ollama + CodeGPT,想拼一个不依赖网络的“类似 Cursor 的智能开发环境”,结果 16G 显存,大一点的模型就捉襟见肘。
那个阶段 AI 能碰到的只有代码本身。代码贴回去以后,跑、看结果、排错、验收,都是我自己。当时的结论也写得很清楚:“其提供的答案仍需验证,不可能一蹴而就”。
二,写代码这件事:从补代码到全流程
Cursor 到现在还是我工作上每天在用的工具。只说写代码这一块,我自己的感受是:
个人感觉最大的变化是可以涉足截屏测试了,从补代码到全流程。
以前它管的是“代码写出来”那一段;现在写完能自己跑起来,截个图看看效果,不对再改,改完再验一遍。中间“跑、看、验”那一圈,以前全是我的活。
三,让它进工作区动手
再往后,开始用 Codex 这类能直接在我机器上干活的工具:查环境、装依赖、改文件、启服务、读日志。那段时间我说得最多的几句话是:
请直接执行
不要只给安装说明
尽量少问我,能检测就自己检测
这一段折腾的东西挺杂。想把几张方向不对的照片按 EXIF 转正,它就转好了,原图还留了备份;想在本地把 Deep-Live-Cam 跑起来,它从部署、启动入口一路弄到从 C 盘搬去 D 盘,再拿 CUDA 试了一把。
也不是每次都圆满。ComfyUI 上的 Qwen-Image 2.1 INT8,模型下好、校验过,两项测试跑通了,可另一个视频节点的导入错误到现在还挂着;TRELLIS.2 从一张图生成的机甲,腿部挺好看,就是有缺损,还是我自己看出来的。剩下还有一堆零碎:ComfyUI 批处理、Blender、翻推理日志看 Token 和缓存……日语翻译和查资料,则更多是交给 ChatGPT。
本地模型:从捉襟见肘到“自由了”
本地 AI 这块,跟两年前那篇比真是两个样子。那时候 Ollama 跑在 16G 显存上,大一点的模型就捉襟见肘。
最近让 Codex 在 RTX 3080 + 4060 两张卡上折腾 Strata,给 OpenCode 当本地模型用。量化、显存分配、双卡分层、批大小,它一项项去试,我只定了一条规矩:每张卡至少留 1GB 显存。最后当时的验收报告里,32K 上下文大约 1896 tok/s Prefill、77 tok/s Decode,冷启动 128K 也还有 1937 / 66 左右;中文、工具多轮调用、看图、关掉重启都过了,OpenCode 那边连接口都不用改。
当然只完整验收到 128K,不同批次的速度也不好拿来比高低。但看着这几个数字,还是忍不住感慨一句:
最近折腾 Strata 跑 Flashnext,本地已经自由了。
它也会误判,比如有一次认定机器上“没有 Python”;显存被一个退出后还挂着的 LM Studio 占着,也是我提醒的。目标、约束和验收还在我这边。
四,以前不会、嫌烦的事,现在都可以了
这两年最实在的感受,用我自己的话说就是:
以前很多不会、嫌烦的事情都可以了。
比如:
- Chrome 扩展:比如一个 Chatwork 的翻译扩展,从最小版本开始,边用边改:消息旁边加个「译」按钮,原文保留、译文显示在下面,走本地 LLM 的 OpenAI 兼容接口。第一版连名字、公司、时间都一起翻了,我指出是页面结构的问题、把真实的 HTML 丢给它,才改成只抽正文;按钮位置、间距、中文字体也调了调,历史消息翻译我确认过没问题。后来又加了「中→日」:输入中文,翻成日语填进输入框,我改改再自己发,读和说的目标语言、提示词分开设置。以前这种属于知道能写、但嫌麻烦的那类,现在工作变简单很多
- 旧 Chromebook 废物利用:后面那一堆用 AI Studio 做的网页应用,很多就是为了让一台旧 Chromebook 用起来,媒体库、PDF 书库、阅读器、小游戏,全都在浏览器里跑
- 掌机程序:手上有台 TrimUI Smart Pro,也让 Codex 帮着折腾过掌机程序,试了 Rust + SDL2 + AArch64 的交叉编译工具链。放在以前,光配环境就够劝退了,下面单独说
掌机:一个项目,几个 AI 分工
掌机这条线也是交给 Codex 折腾的,用 Rust/SDL2 试过好几个小东西,不一定都做完了。其中想做一个 CloudPlayer,让掌机通过 AList 播夸克网盘里的视频,难点是拿到低分辨率、低码率的流。
Codex 很积极,直接写了个 AList 服务端补丁;我把它的思路丢给 ChatGPT 看,ChatGPT 的意见也有点摇摆。最后还是我自己一句话拉回来:
问题是alist不是我维护的好吧?alist就没有提供相关接口?
补丁先放下。再想了想:“发现在游戏机里比较困难,但是如果是构建一个二次封装的站点……”于是需求一整理,交给 AI Studio,做成了一个读 AList 目录、按子目录分类、记住看到哪儿的视频媒体库网站,旧 Chromebook 上也能用。掌机那边另开一个分支留着。
后来掌机上也能播放了,只是码率还是个问题,有些视频卡得厉害。不过这件事挺有意思:一个审方向,一个动手,一个把网页落地,往哪收、边界在哪,还是得我来。
五,铺开到生活的各个角落
1,一句话变成能跑的应用
AI Studio 这类工具,一句话的想法能直接变成跑得起来的网页应用。一开始纯属玩,后来慢慢做成自己用的东西:
- 复古视觉小说原型:90 年代风格,React + Vite,断断续续更新了好几个月
- 大航海时代风格的小游戏:前后做了两版
- MD 模拟器:浏览器里玩老游戏
- 互动体验中心:把下载下来的一个 React 展示站重构、优化了一遍
- AList 视频媒体库:浏览器里的私人视频库和播放器
- Private Library:基于 Cloud SQL PostgreSQL 和安全代理的私人 PDF 藏书馆,带在线阅读
- 个人媒体浏览客户端:移动端的媒体浏览和阅读器
- 一个影视类 Android 客户端:原生 Kotlin,编译、签名 APK,连源码结构浏览和在线预览的下载页一起
从玩游戏原型到签名 APK,中间也就几个月。
2,视频,还有一点历史文化
视频这块主要是 Muse。最完整的一次是三字经 12 集:关键帧串起来保证人物前后一致,再图生视频,ffmpeg 拼起来,配上宣纸风字幕、古琴竹笛和环境音。中途我两次加集,后面三集又从 30 秒改成 60 秒,它都是整条链重跑。
也做了古装短剧《别急着判断别人》,有冲突的画面会被生成器的审核拒掉;还有一条 25 秒的 4K 消防宣传片。敦煌舞 16 格那次,第一版每格都是同一段 3 秒循环,我忍不住说了句“太偷懒了”,返工以后才成了每格 20 秒、各自编排。
3,交给 Muse 托管的杂事
除了做视频,家里机器上的一些杂事也交给了 Muse,而且是交出去以后让它一直跑着:
- 备份:视频备份到 Google Drive,逐个文件核对过才清本地
- pi agent 常驻:环境被重置过好几次,最后装到 home 下面,tmux 挂着,30 分钟一次的看门狗三级自愈,每天凌晨自动轮换免费模型。不过出口代理会拦 Authorization 头,推理还是不通
- 微信 bridge:也接上线了
- 工具链:试了 OpenCode + Codex + Cursor + Blender MCP + ComfyUI MCP 串起来的工作流
- 失败的:想给本机 8082 的 API 服务开个公网隧道,cloudflared、localtunnel、SSH、ngrok 试了一圈,全灭
六,最近:连博客也交出去了
最近又开了 Grok Bot,几个 Bot 各管一摊,背后共用一台持久化的电脑,详细写在 Grok Bot 使用笔记 里了。其中一个管这个博客,简单说两件:
- 博客交出去打理:一次整理了 38 篇文章的标签,改之前先备份、改完逐篇核对
- 图片被拉伸:我截图指出问题,让 Bot 本地用无头 Chrome 渲染,量出图片高度是 1500px,查到是 WordPress 的
sizes="auto"加核心 CSS 的contain-intrinsic-size,加上loading="eager"后前台确认好了;接着首页网格又被特色图撑乱,去掉特色图收工
七,几点感想

回过头来想,变化大概有这么几层:
- 它跑在真实环境里,还会自己验证:不只是给答案,而是装、跑、看、改
- 想法到能跑的东西,变快了:很多原来停在“想想”的事,现在很快就能有个原型
- 可以交出去,让它一直跑着:我口头定的规矩,当天就能变成 cron 和看门狗
- 几个 AI 之间也能分工:一个审方向、一个执行、一个落地成网页,边界和取舍还是人来定
- 我的角色变了:从写代码的人,变成定目标、给规格和红线、最后验收。腿部缺损、偷懒循环、图片拉伸,到最后还是靠我看出来
当然也有代价,换了好几个工具,有些坑几乎每个都会踩:
- 环境误判:认定“没有 Python”、权限不够探测不到,结论先下了
- 网络:沙箱、出口代理、隧道,经常是最卡的地方
- 环境易失:重置一次就没了,只有 home 下面的东西靠得住
- 生成器审核:有冲突的画面直接被拒
- 偷懒交付:看起来完成了,其实是循环、凑数
- 免费额度:免费模型限速、限流,说没就没
- 上下文连续性:换个会话就得重新交代一遍,我说过“不要每开一个线程都要问”,现在也只是好了一些
中间也玩过 OpenClaw,感觉它算是起了个头,结果给人做了嫁衣。它不分目录,以现在的上下文和注意力来说,可能还太超前了。
总结
两年前:
AI 是编辑器里帮我补代码的
现在:
写代码、翻译、做视频、做小应用、管博客、看家里的机器
到处都有它
文中写到的,也只是十之一二。
“答案仍需验证”这句话,两年前写的,今天看依然没过时。只是以前很多不会、嫌烦的事,现在都可以试试了。
这些只是我个人的感受,抛砖引玉。再过两年回头看这篇,估计又会觉得很原始吧。