GitHub 每周精选|2026 W25

GitHub 上每天都会冒出很多新项目。

大多数我都会看过就忘。

有些看起来很酷,但装完就吃灰。

还有一些,会让我真的想留下来继续折腾。

我想把这些项目记录下来。

不追求“最火”。

只记录那些:

让我真正想装下来试试的东西。


1. 人味 skill

项目名:renwei-writing

GitHub 仓库地址: https://github.com/orange2ai/renwei-writing

这是继 web-access 之后,我基本上天天会使用的 skill,目前还不到 1k 的 star,暂时算是不温不火的状态

从这个仓库名称也基本可以猜到这个仓库的作用到底是什么了,没错就是输出的时候更有人味

这里我没有单独去做一个用和不用这个 skill 输出的文本的实验了,因为自从用了这个 skill 之后,就基本没有在创作的时候不用这个 skill 了

如果你是一名创作者的话,这个 skill 大抵会让你爱不释手的

虽然这个 skill 的效果确实很不错,但对于输出的内容并不能做到真正的全部使用,还是需要人的创作指导的,要不人味依然不会很高

2. andrej-karpathy-skills

项目名:andrej-karpathy-skills

GitHub 仓库地址: https://github.com/multica-ai/andrej-karpathy-skills

Andrej Karpathy 在 26 年的 1 月发了一条推特,来聊了聊过去几周大量使用Claude编程的一些零散想法,有 770 万次浏览量,推特链接如下:

https://x.com/karpathy/status/2015883857489522876

这里也简单介绍一下 Andrej Karpathy 的背景

Andrej Karpathy 是 AI 研究者与工程实践者,OpenAI 创始团队成员之一,后担任 Tesla Autopilot 视觉方向负责人


在这条推特当中,Andrej Karpathy 聊到了现在 AI 智能体在编码时的一些问题,这里我还是觉得直接放原文会好一些,相信这也是大家在用 AI 智能体编码时多多少少会遇到的一个问题

image.png

为了解决上面的问题,就有这个仓库,ndrej-karpathy-skills 做的事情,就是把以上问题压缩成 4 条规则(以下不是完整的 skill 内容):

  1. 编码前先思考:不要默默假设,有歧义就说出来
  2. 简洁优先:能 50 行解决,就不要写成 200 行
  3. 精准修改:只动和当前任务有关的地方,不顺手重构
  4. 目标驱动执行:不要只说“修一下”,而是定义可验证的成功标准

优先是很轻,可以直接将这个 skill 安装到 AI Agent 当中,或者直接写进 CLAUDE.md 或者 AGENTS.md 都是可以的,可以一定程度上解决上面的问题

缺点也是比较明显的,它不是强约束,它不会像类型系统、测试、lint 那样硬性拦住错误,能减少犯错的概率,但并不能杜绝错误的发生

比如关于 "编码前先思考" 这点,用 superpower 的效果会更好


至于使用人群的话,如果你打算用 AI 认真写代码,那么值得一试,它做了一件很朴素的事情:AI coding 的下一步,不只是让模型更会写代码,也要让模型少乱写代码

image.png

3. guizang-social-card-skill

项目名:guizang-social-card-skill

GitHub 仓库地址: https://github.com/op7418/guizang-social-card-skill

藏师傅的新作品,之前也有推荐过藏师傅的 PPT skill,感兴趣的话可以点击下面的链接去看一下

https://zhuanlan.zhihu.com/p/2040526006285509057

优点有如下几个:

第一:延续上次 guizang-ppt-skill 的两种风格,审美起点更高

不是让你从零调字体、颜色、间距,而是先给你一套有约束的视觉语言。这个约束反而是好事,因为大多数内容图做丑,不是因为自由不够,而是因为自由太多

第二:适合长文拆图

说成大白话就是为文章配图,将一片文章拆成 5 到 9 张小红书卡片,它能从结构、标题、重点句、截图排布这些地方一起处理,不只是做一张封面

第三:修改成本低

最初的产物是单文件 HTML,再用 Playwright 渲染成 PNG。HTML 和 CSS 都能继续改,出问题也能查,不像很多在线设计工具,最后只剩一个不可控的导出结果

当然我也需要说一说局限性,原配的 skill 主要是生成小红书和公众号内容的,这两个平台的图片比例为 3:4 和 21:9,对于 4:3 和 16:9 比例的支持稍微差一些,我第一次在生成 16:9 的配图时出现了配图模糊的情况,后续在原配的基础上进行一些改进,顺利的解决了这个问题,这一点有必要告诉大家

image.png

4. agent-skills

项目名:agent-skills

GitHub 仓库地址: https://github.com/addyosmani/agent-skills

区别于很多 "角色大全" 式的 skill 合集,产品、运营、设计、销售、法务、数据分析都来一点,看起来很全

agent-skills 的重心收得很窄,基本围绕软件开发这条线展开:从需求澄清、写规格、拆任务,到编码、测试、调试、代码审查、安全、性能、CI/CD、发布、监控和迁移废弃

所以它更像是把一个资深工程团队的日常习惯拆开,写成 AI coding agent 可以照着执行的工作流

里面不只是“你是一个前端工程师”这种角色设定,还会告诉agent:什么时候该写 spec,什么时候该停下来补测试,什么时候该做安全检查,什么时候该考虑回滚和可观测性等等

image.png

5. whisper

项目名:whisper

GitHub 仓库地址: https://github.com/openai/whisper

如果单说功能的话,这个仓库的功能是极其简单的:

将视频 / 音频转换成文字稿

而且这个文字稿也不是完美的。**它不会顺手帮你清理语气词,不会自动帮你删除重复表达,对一些专业名词、人名、品牌名的识别也不总是稳定。**你如果拿它的结果直接发出去,往往还是要自己再校对一遍

对于做字幕,没有剪映方便

对于视频会议的转写也没有腾讯会议、飞书会议方便

对于只是偶尔转一段采访或者播客,现在市面上也有很多现成工具能做,比如 TurboScribe、Riverside、VEED、Otter、Notta,中文场景里还有飞书妙记、通义听悟这类产品,很多都比它更省事


那我为什么还想要来推荐这个仓库呢?

第一点是,它足够便宜,准确点说,是几乎没有使用门槛上的持续成本

很多在线转写产品表面上能免费试,但真正想长期用,要么限制分钟数,要么限制文件大小,要么导出字幕和全文稿时开始收费

Whisper 不一样。环境装好、模型下载好之后,它就是一个可以一直放在你电脑上的本地工具。你不用反复算时长,也不用担心哪天平台把免费额度收紧

第二点是,它是本地可控的

你的视频、录音、采访、会议材料,不需要上传到第三方网站。这个差别平时不明显,但一旦素材涉及客户、内部沟通、未发布内容、个人隐私,你就会知道“本地处理”这四个字有多值钱。很多产品更方便,但方便的代价就是文件先出去;Whisper 不是。

第三点是,它虽然简单,但它简单得很像一个基座

很多成品工具解决的是“给你一个结果”,Whisper 解决的是“把音频转文字这一步,变成你自己手里的一项能力”

你可以拿它输出 .txt、.srt、.vtt、.json,然后继续接自己的工作流:字幕、归档、摘要、检索、内容拆条、AI 总结,后面怎么接都行

这也是它和剪映、飞书会议、腾讯会议这类工具最大的差异点。那些工具是成品,目标是让普通用户少折腾;Whisper 是底层能力,目标是让你自己决定后面怎么用

它的优点说白了就三个:免费、本地、通用

它的缺点也很明确:不够傻瓜、不够省心、结果不够干净、后处理要靠自己


所以它并不是一个适合所有人的仓库

如果你只是想偶尔给视频加字幕,剪映更合适

如果你主要是开会并且想自动生成纪要,腾讯会议、飞书会议更合适。

如果你不想碰命令行,也不想自己管模型和环境,那各种在线转写网站也更合适


但如果你属于下面这几类人,Whisper 就很值得看一眼:

你经常要处理录音、播客、口播、采访、课程、会议素材; 你在意隐私,不想把文件上传到第三方平台; 你想把“音频转文字”这一步沉淀成一个长期可用的本地能力; 或者你是开发者,后面还想接字幕、摘要、检索、自动化流程

对这些人来说,Whisper 的价值不在于它做得比所有产品都更好,而在于它把最基础、也最关键的一步,稳定地交回到了你自己手里。

如果要给它一句比较准确的定位,我会更愿意这么说:

Whisper 不是最好用的视频转文字产品,但它是很值得拥有的本地转写底座

image.png


最后:

后面肯定还会继续遇到:

让我真正想装下来试试的项目。

这个系列也会继续更新下去。

0个评论
点击登录,快来和大家讨论吧~
表情
图片
暂无评论
花萍雨
下载 APP