【原创项目】Flow Forge - AI接口测试框架,支持Codex等智能体以及本地部署的弱模型
为AI接口测试提供两条路径:可以把skill接入Codex等智能体,实现一键从生成到执行和报告;可以使用llama.cpp / Ollama 等本地弱模型结合AI工作流,实现用例生成。支持编写和执行一个完整的业务链路。提供GUI工作台。
开源地址
需要把代码完整下载到本地,因为skill需要配套的代码才可以使用。GUI工作台在GitHub release提供了Windows的安装包。仓库中也提供了一些做好的测试用例和报告供参考:简单电商项目示例。如果感觉这个项目有帮助的话,麻烦帮我点个star,感谢。如果有bug或者需要新功能的话,也欢迎在issue中提交,我会及时更新的。 Flow Forge — 接口自动化测试框架
功能特性
- 测试用例的特性:测试用例就是yaml或者excel文件,把用例扔给执行器就可以直接运行。不过像是数据库、MQ和Redis这种插件可能还是需要一些代码(可以用智能体生成)。用例不光是单接口的用例,还支持整个业务链路的顺序执行。
- Codex等智能体的SKILL:这是我最推荐的一个用法。在 flowforge-testing/ 中,我本地测试这个SKILL用的是Codex + deepseek-v4-flash,可以从需求和接口文档直接完成用例生成、校验、执行插件的补充、执行以及分诊。分诊就是它能够判断失败的用例是因为用例写错了,还是业务有bug。用例写错了还会自己改用例,直到通过或者确定是业务bug。 有plan模式,可以先审核计划再执行后续任务。上面说的插件也可以让它来编写和测试。
- llama.cpp / Ollama 本地模型的工作流:我测试功能用的是Qwen3-8B-Q4_K_M,-c 64000。这种就是适合公司不让用API的内网用户尝试。弱模型幻觉还是比较明显的,agent/中提供了一个AI工作流,也是能够从需求和接口文档生成测试用例。有plan模式。有resume模式,可以从断点恢复执行。不过生成的用例基本上就是给搭个架子,需要修改的东西可能比较多。然后生成速度会慢一些(速度取决于LLM执行的速度以及设置合适的batchsize)。仓库里也有弱模型配置参考文件:配置文件。后面我会说一些我试过的模型以及踩过的坑。
- Studio 桌面工作台(Windows):在GitHub release里有Windows的安装包,可以直接运行。这个就是给智能体工作流、用例编辑器、用例执行器和用例转换器提供了UI界面。首次使用需要在右上角设置
⚙中配置python环境以及agent/和python/目录地址。




- 用例执行器:执行器,内部有登录态管理器,通过
#{}触发,能自动管理登录态(不过目前只验证过JWT这类的登录态),业务链路用例的每个步骤之间传数据也支持,有两级断言引擎,能并发执行用例(非压力测试,并且需要用例之间互斥),有插件系统(目前已经做了一些插件,这些插件也可以直接让智能体做)。因为执行器是CLI的,所以可以集成到Jenkins,每天定时执行这种功能也支持。 - 用例转换器:转换器,目前支持四种:excel2yaml、yaml2excel、yaml2pytest、excel2pytest。pytest是尽可能原生的(.py里有命令,可以直接执行),也会把所有的插件都打包,单独放一个包里。
整体架构
▼mermaid复制代码graph TD REQ[需求文档] --> PA[路径 A:强智能体 + flowforge-testing skill] API[接口文档] --> PA REQ --> PB[路径 B:agent/ LangGraph 弱模型流水线] API --> PB PA --> |测试计划 + 人工审核| CASES[YAML / Excel 用例] PB --> |测试计划 + 人工审核| CASES CASES --> STUDIO[Studio 可视化编辑 / 批注] STUDIO --> EXEC[执行器] CASES --> EXEC EXEC --> REPORT[HTML 报告] EXEC --> |退出码 0/1/2| CI[Jenkins CI/CD]
适合人群
- 开发,但需要兼顾测试,需要工作留痕,可以试一试我的工具。建议用法是接入Codex + deepseek-v4-flash(不是不建议其他智能体或模型,因为其他的我暂时没试过。ds4f个人感觉够用)。AI生成用例并执行之后,会生成yaml文件和测试报告。这些用例文件可以直接用执行器来执行。项目内也提供了一个桌面应用,不需要每次都敲命令。后续万一有bug可以翻一翻用例文件,然后甩锅/doge。
- 测试,但平时工作量比较饱和,可以从边缘业务开始尝试一下。建议用法也是接入Codex + deepseek-v4-flash。因为这个项目算是刚刚可用,可能很多特性或者功能还不算太完善,太复杂的用例可能不一定支持。如果公司对于测试质量的要求很高的话,可以先观望一下或者在issue中提一提需要的功能或特性。目前这个项目应付一下冒烟测试,或者用生成好的用例结合Jenkins做定期测试这种,大概是可以的。
- 内网用户,仍然在手写用例,可以尝试一下。如果公司的模型相对强一些,可以试一试用智能体接入本地模型。但如果是Qwen3-8B-Q4_K_M这种级别的模型,也可以试试(我目前还没试过)。实在不行的话,用AI工作流也可以,至少搭个架子没问题。AI工作流也支持plan模式,也有UI界面。
在使用GUI运行AI工作流,测试计划审核环节,如果用的模型比较弱,对于一些简单的计划错误(比如多了某个用例,描述轻微不对),可以双击文本块后,在批注器右侧手动修改。因为弱模型修改的话,可能会把整个块都修改了。
弱模型 + AI工作流使用经验
这个项目大概做了两个多月,期间试过deepseek4flash预览版、GLM-4.7-flash的免费API、Qwen2.5coder:14B(ollama,量化版本忘了)、Qwen3-8B-Q4_K_M(llama.cpp)和Qwen3.5-4B-Q4_K_M(llama.cpp)。 因为这个AI工作流主要是针对弱模型设计的,所以强模型千万不要尝试接入,有很多工程优化可能会浪费token。强模型直接往Codex接。比如deepseek-v4-flash正式版。 用AI工作流生成用例的话建议用Excel格式的用例做首轮编辑,因为对批量编辑更友好。如果需要做diff,再转化成yaml用例。
- GLM-4.7-flash的免费API,没有执行到最终结果,因为它会疯狂报500,然后每次请求需要间隔3秒左右,如果调用失败了需要等90秒,不然会报429 too many request(好像是)。agent/中有很多参数都是为了这种免费API搞的。中间产物的话,效果看起来还行,印象里体感上可能接近deepseek4flash预览版,但是生成个用例比本地部署模型还慢。大概是6月初测试的,记忆不一定完全准确。模型可能不错,但是API确实有些一言难尽,不推荐尝试API。
- Qwen2.5coder:14B和Qwen3-8B-Q4_K_M的思考模式,体感上差不多。Qwen3-8B-Q4_K_M生成测试计划的能力还是明显比2.5好的。虽然后面的业务链路用例生成的步骤有挺多时候直接都是不对,缺个步骤啥的,用例名称用例描述给生成个英文(有兜底翻译智能体)的等等,不过至少搭个架子还行。条件实在有限的话,应该也能凑合用。
Qwen3-8B-Q4_K_M 偶尔会输出空的json数据
{},一般是执行到case生成环节出现,有时稳定复现,比如用例的描述“生成超长用户名1024”。像这种稳定复现的情况,修改一下描述,比如“生成较长用户名”,resume恢复执行,可能就过去了,后续再手动修改一下即可。
- Qwen3.5-4B-Q4_K_M,印象最深刻的就是它经常会输出空的json数据
{},运气成分比较大,也是没完整执行过。不过像是Qwen3-8B-Q4_K_M生成的用例,如果用例名称和用例描述生成的是非中文,agent/里提供了一个兜底智能体,能翻译用例。CLI命令也很简约,能自动识别用例类型并翻译。一行命令就可以。
技术栈
| 组件 | 技术 |
|---|---|
| Studio 桌面应用 | Vue 3, Ant Design Vue, Vite, Tauri 2, TypeScript |
| agent 弱模型流水线 | Python 3.12, LangGraph, OpenAI 兼容 API, prance (OpenAPI), pymupdf (PDF) |
| skill 工具脚本 | Python 3.12(ff_tool / resolve_python,复用 python/ 执行器与转换器) |
| 执行器与转换器 | Python 3.12, requests, openpyxl, pyyaml |
| CI/CD | Jenkins Pipeline, 命令行退出码 |
结语
像是功能原理之类的,因为代码仓库里都有,所以我也就不赘述了。我做这个项目很大一部分原因是很多年以来就一直想自己做个什么项目,然后最好有人能觉得好用。现在AI编程发达了之后,正好我在自动化测试这块算是有点经验,所以就做了这个项目。如果对你有帮助的话,麻烦帮我点个star,如果项目有bug或者有需要的新功能/特性,也欢迎在issue中提出来,我会及时更新的。

