新AI模型 Jev 实战:概念、场景和两个实战

一、一个不写字的模型

9 月 15 日,一条推文在开发者社区里传开。

发帖人是 Diogo Almeida。他说自己参与发明了 ChatGPT,然后一直在问自己一个问题:为什么对话模型已经强到超人,AGI 还是没有出现?过去两年他"隐身",用一种新的训练方法(RLCD)训出了一个新类型的模型,今天发布,名字叫 Jev。

他给出的数字:快 20–200 倍,便宜 40–400 倍。TypeSafe AI 同期宣布了 4000 万美元种子轮。

接下来几天,用 TechCrunch 的标题概括就是:"一个来自 ChatGPT 发明者的新型 AI 模型,正在让开发者兴奋。"Reddit 上 r/ArtificialInteligence 的帖子一天之内冲到 120+ 评论,标题是"Jev / TypesafeAI is revolutionary as LLM's",正文第一句:"Jev is insane."X 上 @0xCodila 说这是 AI 行业的"互联网时刻",@akshay_pachaar 的总结是:"我们一直拿 LLM 当锤子,敲每一个 AI 问题,哪怕是再简单不过的判断。Jev 用毫秒和零头的成本把这些判断接了过去。"中文社区里,@Saccc_c 的推荐很直接:"强烈建议大家都亲自试试 Jev,能让你的 Codex 操作速度提高 10 倍并省下大量 token。"

同时,接下来的这几天,我的X时间线全被jev刷屏了。

社区的动作也很快。一周之内,已经长出一圈配套工具:给 Claude Code 和 Codex 用的代码评审插件 jev-review、官方的 TypeSafe Skill、把命令风险检查接进 Claude Code hook 的脚本,还有人做了 jevable.com,把散落在 X 上的演示项目收集成可筛选的目录。有人把 X 上 28 个 Jev 用例归成八个方向,从 Agent 调度、记忆筛选、代码质量检查,到浏览器操作、业务分流、实时交互辅助和游戏控制。这些方向的共同点是:判断高频发生、候选范围有限、需要理解语境,而且错了能发现、能补救。一批资源站也纷纷涌现。

但有个事实绕不开:Jev 不做生成。

它不会写文章,不会写代码,不会跟你聊天,也不能解释自己为什么这么选。你给它一段状态(state)和几个带选项的问题,它返回一组类型化的答案和概率,然后停止。

当所有人都在比谁的模型写得更长、更像人的时候,TypeSafe 走的是另一个方向,把模型做成软件里的一个判断原语。最通俗的类比,是一个聪明的 if 语句。

阅读全文

如果你不能外包你的理解,你咋掌控AI写的那一大坨代码

上一篇文章的结尾,我留了一个话题。

我引用了那句话:"你可以外包你的思考,但是你不能外包你的理解。"

有读者在后台问我:道理都懂,可 AI 一天给我生成的代码,比我自己一年写的都多。思考我可以外包给 AI,理解我肯定要自己消化——但是消化也得有时间和精力啊。生成是光速,理解是步行,AI拉的是一大坨,理解缺是要细嚼慢咽,这道题怎么解?

阅读全文

测试最新的几个大模型创建五子棋游戏

告诉coding agent一句话: 『实现一个网页版五子棋游戏』,对比目前各最新的大模型的能力。测试不一定很科学的测试个大模型的能力,只能说从一个用例方向上做对比。

综合分析

同一句提示词「实现一个网页版五子棋游戏」,通过 pigo 命令行、medium 思考档位,分别丢给 8 个最新模型,得到的结果差异相当明显。总体上每个模型都完成了「能玩的五子棋」这个基本盘,但在是否带 AI 对弈、运行方式、设计审美、工程严谨度四个维度上分化清晰。其中 deepseek-v4-flash 和 kimi-k3 是综合表现最好的两个——功能全、AI 实测能用,而且都自带了测试。

阅读全文

使用 Go 语言开发Pi coding agent, 以AI自主的方式

pigo 是一个类似pi coding agent的ai coding agent,使用Go语言开发。

你可以通过下面的命令安装它:

1
curl -fsSL https://raw.githubusercontent.com/smallnest/pigo/master/install.sh | sh

在配置文件配置(推荐),或者命令行中输入参数也可以:

尝试了它的功能,你一定好奇,这样一个功能完备的ai coding agent是怎么快速开发出来的?

开发这个项目主要有两个目的,而且这两个目的都达到了:

  • 为Go生态圈提供一个小巧灵活,功能强大、易于扩展的Agent, 就像 Pi agent、Claude code那样。既可以作为coding agent日常使用,也可以作为SDK方便集成到Go程序中使用
  • 通过真实的项目证明,goal-workflow这套从需求到上线这套AI时代的软件开发工程方法非常有效,可以舒舒服服的开发中小型应用,而且也适合AI主导的项目后期的维护

所以本文想从这两个方面分享从零开发这个项目的经验,同学可以各取所取,从不同的关注点了解这个过程。

阅读全文

Graph Engineering:从Loop到Graph,以及 graph skill 的一次真实实践

继 prompt engineering、context engineering、harness engineering、loop engineering 之后,2026 年 7 月又冒出来一个新词:graph engineering(图工程)。

X 上照例吵成一团:有人说这是又一次新瓶装旧酒的炒作,"图"根本不是什么新东西;有人说循环(loop)已经过时,图才是 Agent 编排的终极形态。towards_AI 那篇《这该死的图工程到底是什么》给了一个很克制的判断:

There is no new product called Graph. And loops are not going anywhere.
loops versus graphs is the wrong argument. Graphs have loops.

这篇文章分三部分:先讲清楚图工程到底是什么(历史、概念、理论),再介绍一个把图工程做成可用工具的 skill —— goal-workflow 里的 /graph,最后拿我自己正在跑的一个真实项目 pigo,看看 /graph 跑起来到底长什么样、产出什么东西。


阅读全文

Matt Pocock 的工作流:从一个模糊想法到可交付代码

TypeScript 名师 Matt Pocock 开源了一套 Claude Code Skills(https://github.com/mattpocock/skills)。据他在 X(Twitter)上的说明,这套 skills 的核心是 5 个命令串起来的一条主线:

/grill-with-docs → /to-spec → /to-tickets → /implement → /code-review

即:先把想法拷问清楚 → 写成规范 → 拆成卡片 → 动手实现 → 双轴评审。

这套 skills 的问题在于文档跟不上功能,很多人拿到手不知道怎么用。我此前也搭过一套类似流程,并用这套 skills 开发了一个 Go 版本的 pi agent(https://github.com/smallnest/pigo ,仓库里的 issues 都是这套 skill 生成的),因此对它的运作有一定了解。本文介绍这套流程。

安装命令:

1
npx skills add mattpocock/skills

阅读全文

循环入门

封面图

最近大家都在聊「设计循环(loops)」,而不是给你的编码 agent 写提示词。但如果你在 X 上花点时间想搞清楚循环到底是什么,会发现众说纷纭。

在 Claude Code 团队,我们把循环定义为:agent 反复执行一轮又一轮的工作,直到满足某个终止条件。我们按以下几个维度,把循环分成几种类型:

  • 如何触发
  • 如何终止
  • 用到哪个 Claude Code 原语(primitive)
  • 最适合处理哪类任务

下面会讲清楚主要的循环类型、各自的适用场景,以及如何在控制 token 用量的同时保住代码质量。不是所有任务都需要复杂的循环——先从最简单的方案入手,按需选用这些模式。

阅读全文

代码在发臭:一个能"闻"出坏味道的 AI 技能,我拿它扫了最新的开源代码

「任何傻瓜都能写出计算机能懂的代码。好的程序员写出人能懂的代码。」——Martin Fowler

你有没有过这种感觉:打开一个文件,还没读懂逻辑,先皱起了眉头。说不上哪儿错了,但就是觉得"不对劲"。

这种"不对劲",有个专门的名字——代码坏味道(Code Smell)。

它不是 bug,代码跑得好好的;它也不是编译错误,测试全绿。它只是一种表面的征兆,暗示底下可能藏着更深的问题。就像厨房里飘来一丝馊味,东西还没坏透,但你知道该去冰箱里翻一翻了。

这篇文章讲三件事:这个词是怎么来的、坏味道到底有哪几类、以及——我怎么用一个 AI 技能,把一个真实开源项目的核心代码"闻"了个遍。


阅读全文

我把775篇收藏塞进4MB向量库:一个比Karpathy Wiki更能"翻箱底"的RAG skill

我把 775 篇收藏的文章塞进一个 4MB 的向量库,然后问它:"我都收藏过哪些关于 loop engineering 的资料?"三秒钟,它把散在六七篇文章里的观点拼成一段答案,每条都带出处。

这不是什么 SaaS 产品,是我自己写的一个 skill,叫 chao-rag-wiki。今天聊聊它,顺便聊聊它背后那个问题:知识库越攒越大,你到底怎么"读"它?

得先从 Karpathy 的一个想法说起。


阅读全文