开发者Club开发者Club

GitHub 周刊第 46 期 | 5 个让 AI 闭嘴干活的开源神器

> 📅 本期时间范围:2026 年 9 月第 2 周(2026-09-07 ~ 2026-09-13)

开发者Club
GitHub开源项目AI Agent语音克隆RAG开发工具
阅读 收藏

📅 本期时间范围:2026 年 9 月第 2 周(2026-09-07 ~ 2026-09-13)

本周逛逛 GitHub,热榜的气氛有点微妙。

前几周大家还在卷"给 AI 加更多能力",这周风向突然反过来了——榜首那个一周涨了一万三千星的项目,干的事情居然是让 AI 少说话。第二个热门项目,核心卖点是让 AI 少占地方。合着大家用了半年 AI 编程,最大的痛点不是它不够聪明,而是它太啰嗦。

这期挑了 5 个,两个"管住 AI 嘴"的,一个把 HTML 渲染成视频的,一个能在自己电脑上克隆声音的,还有一个腾讯开源的知识库平台。一起看看。

01 i-have-adhd

一个专治 AI 废话的 Agent 技能

i-have-adhd 的改造效果对比

先说本周的榜首,ayghri/i-have-adhd,42.9k Star,光这一周就涨了 1.3 万星,增速第一。

项目名字挺唬人,但作者在 README 里第一句就写了:"ADHD-friendly outputs. No ADHD diagnosis needed!"(不需要确诊也能用)。它解决的是一个所有用过 AI 编程工具的人都懂的问题:你问它一个具体问题,它先夸你"这是个好问题",然后铺开三段背景分析,最后把答案埋在第四段里。

上面那张图就是它的效果对比。左边"Before"是 AI 的原始回答:一段话讲完中间件、token 校验、cookie 处理,绕了一圈说"你可以考虑升级这个包然后重写那个函数",最后以一句"Hope this helps!"收尾。右边"After"是装了这个技能之后:

Run npm install jsonwebtoken@latest, then edit src/auth.ts:42.
1. Open src/auth.ts
2. Replace verifyToken (lines 42-58) with the snippet below
3. Run npm test -- auth.spec.ts

第一行就是"你现在该干什么",后面是编号步骤,结尾给一个明确的下一步。没有寒暄,没有铺垫。

它的实现方式不复杂,本质就是 10 条写死的规则,塞进 Agent 的 skill 里:动作打头、多步任务必须编号、结尾给一个具体的下一步、压制跑题、每轮重述当前状态、列表最多 5 项、不许说"希望有帮助"这类填充句。另外一条我觉得特别实在——要给具体的时间估计,不许说"很快就好"

安装极简单,把这句话粘进你的 CLI 就行:

Install the i-have-adhd skill/plugin from https://github.com/ayghri/i-have-adhd

实用场景

  • 适合每天跟 Claude Code、Cursor、Codex、Gemini CLI 打交道的人
  • 适合用 AI 排查线上问题时——这种时候你最不需要的就是"让我先梳理一下你的架构"
  • 规则全在 SKILL.md 里,觉得哪条太狠可以 fork 掉自己改

核心功能

  • 10 条强制输出规则,动作优先、步骤编号
  • 支持 Claude、Cursor、Codex、Gemini CLI、OpenCode、Kimi、Qwen 等多家客户端,各自有独立的 plugin 配置
  • 仓库里带 evals 目录,作者做了可复现的技能质量评测
  • MIT 协议,41 位贡献者,README 有中文等 7 种语言版本

开源地址:https://github.com/ayghri/i-have-adhd

02 VoiceStudio

能在自己电脑上跑的 ElevenLabs 替代品,支持 646 种语言

VoiceStudio 的模型市场

debpalash/VoiceStudio,22.8k Star,Python + TypeScript,本周热度很高。

一句话介绍:完全本地运行的 ElevenLabs 替代品。声音克隆、音色设计、视频配音、听写、转录、有声书制作,全都有,而且号称支持 646 种语言——ElevenLabs 官方是 32 种。

我觉得这个项目最值钱的地方不是功能多,而是"全本地"这三个字带来的几个结构性差别:没有按字符计费,没有额度上限,音频不出本机。 你给客户做配音、拿内部录音做转录,数据不用往外发。协议是 AGPL-3.0,没有付费版,没有隐藏额度。

切换音色的实时演示

具体能干什么:

  • 声音克隆与设计:给一段参考音频就能 zero-shot 合成,也可以用文字描述参数直接"设计"一个音色
  • 视频配音:自动转录 → 翻译 → 保留说话人身份 → 合成多语种配音,一条链路走完
  • 有声书:支持导入 EPUB / PDF,多角色多音色脚本,直接导出 .m4b
  • 听写挂件:全系统范围的语音转文字,还能接本地 LLM 做二次润色
  • 模型市场:上图那个界面,内置 16 个 TTS 引擎和 11 个 ASR 引擎,一键装

TTS 这边默认引擎是自家的 OmniVoice,另外可选 CosyVoice 3、GPT-SoVITS、VoxCPM2、IndexTTS、MLX-Audio、Sherpa-ONNX 等等,中文用户熟悉的几个主力都在。ASR 默认 WhisperX,也支持 Faster-Whisper、FunASR、Parakeet TDT、MLX Whisper。它还提供 OpenAI 兼容的 API 端点和 MCP Server,想接到自己的流水线里很方便。

实用场景

  • 适合做短视频、播客、有声书的内容创作者
  • 适合需要多语种配音但不想让素材上云的团队
  • 适合想本地跑 TTS/ASR 又懒得一个个配环境的人——模型市场帮你省了大半天

硬件门槛(作者给的建议):

  • 最低:8GB 内存 + 现代 CPU
  • 推荐:16GB 内存 + 6GB 显存以上的 NVIDIA 显卡
  • 最佳:32GB 内存 + 高端显卡
  • macOS / Windows / Linux 都有安装包,也提供 Docker 镜像

开源地址:https://github.com/debpalash/VoiceStudio

03 HyperFrames

写 HTML,渲染出视频,专为 AI Agent 设计

HyperFrames 的 frame.md 设计入口

heygen-com/hyperframes,49.1k Star,TypeScript,HeyGen 开源的。README 的 slogan 只有三句话:"Write HTML. Render video. Built for agents."

它把 HTML、CSS、媒体资源和动画,渲染成确定性的 MP4。所谓确定性,意思是同样的输入必定产出完全一样的输出——这一点是它跟其他视频框架最大的区别,因为这意味着你可以把视频渲染放进 CI/CD,甚至给视频写回归测试。

另一个我觉得聪明的设计:不用 React。编排文件就是普通 HTML,动画信息靠 data 属性描述。这样一来,AI Agent 写起来毫无门槛——它本来就最擅长写 HTML。项目直接提供了 Agent 技能,Claude Code、Cursor、Gemini CLI 都能装:

# 给 AI Agent 装技能
npx skills add heygen-com/hyperframes
 
# 或者自己用 CLI
npx hyperframes init my-video
cd my-video
npx hyperframes preview   # 浏览器实时预览
npx hyperframes render    # 输出 MP4

环境要求 Node.js 22+ 和 FFmpeg。

动画层它做了适配器,GSAP、CSS 动画、Lottie、Three.js、Anime.js、Web Animation API 都能用,想上 3D 也不用换框架。另外有个 catalog 系统,转场、字幕、图表、遮罩这些常用块都是现成的,拼起来就能用。渲染路径给了三条:本地、Docker、AWS Lambda,量大了可以直接上分布式。

上面那张图是官网的 frame.md 入口:你写一份 design.md 描述品牌调性,frame.md 描述画面编排,它帮你翻译成 16:9 的节奏、缩放和停留时长。官网还挂了几十套预制模板(Biennale Yellow、BlockFrame、Bold Poster 之类),风格挺编辑感的。

实用场景

  • 适合要批量产出短视频的内容团队——模板化 + 数据驱动最省事
  • 适合想让 AI 自动做视频的人,这可能是目前 Agent 友好度最高的方案
  • 适合前端出身的人做视频,你已有的 CSS 手艺能直接复用

核心功能

  • HTML 原生编排,无框架依赖
  • 确定性渲染,可进 CI、可做回归测试
  • 六种动画适配器,转场/字幕/图表有现成块
  • 本地 / Docker / Lambda 三种渲染路径
  • Apache 2.0 协议

开源地址:https://github.com/heygen-com/hyperframes

04 Context Mode

把工具输出砍掉 98%,顺手治好 AI 的失忆

Context Mode 的解决思路

mksglu/context-mode,22.3k Star,TypeScript。README 的副标题写着:"The other half of the context problem."(上下文问题的另一半)

它描述的问题我感同身受:每一次 MCP 工具调用,都是往你的上下文窗口里倒原始数据。 作者给了具体数字:一个 Playwright 快照 56 KB,20 条 GitHub issue 59 KB,一份访问日志 45 KB。半小时之后,40% 的上下文就没了。更糟的是,Agent 为了腾地方去压缩对话,压完就忘了自己在改哪个文件、哪些任务还没做完、你上一句问的是什么。

它是一个 MCP Server,从四个方向下手:

  1. 上下文节流:工具在沙箱里跑,原始数据不进上下文窗口。作者给的例子是 315 KB 压到 5.4 KB,约 98% 的削减
  2. 会话连续性:每一次文件编辑、git 操作、任务、报错、用户决策,全都记进 SQLite,用 FTS5 建索引、BM25 排序检索。对话被压缩时不是把数据一股脑倒回上下文,而是按需捞相关的那几条
  3. Think in Code:这条是它的核心理念——LLM 应该写分析脚本,而不是自己当计算器。要统计 50 个文件里的函数数量,不是把 50 个文件读进上下文,而是写个脚本数完 console.log 结果。README 里的对比是:47 次 Read 调用 700 KB,换成 1 次 ctx_execute 只要 3.6 KB
  4. 知识库索引:URL 和 markdown 可以索引进来,按需取片段,默认 24 小时 TTL 缓存

沙箱支持 12 种运行时(JS、Python、Go、Rust 等),平台适配了 17 家:Claude Code、Gemini CLI、VS Code Copilot、Cursor、OpenCode、OpenClaw、Codex CLI、Kimi Code、Qwen Code、Antigravity、Kiro、Zed、Pi 等等。

安装以 Claude Code 最省事:

/plugin marketplace add mksglu/context-mode

也可以 npm install -g context-mode

有个细节得说清楚:98% 这个数字是配上 hooks 之后的,不挂 hooks 大约 60%。 另外它的协议是 ELv2(Elastic License 2.0),不是标准开源协议,商用前记得看一眼条款。

实用场景

  • 适合上下文老是被工具输出撑爆的重度 Agent 用户
  • 适合经常跑长任务、被"压缩后失忆"折磨过的人
  • 适合按 token 付费、想省钱的团队

开源地址:https://github.com/mksglu/context-mode

05 WeKnora

腾讯开源的知识库平台,能自己长出一个 Wiki

WeKnora 的 Agent 问答

最后放一个国内项目。Tencent/WeKnora,22.5k Star,Go 写的后端 + Vue 前端,MIT 协议。

它是个 LLM 知识库平台,把散落的文档变成能问能答的系统。听起来像又一个 RAG 框架,但它有两个点跟常见的 RAG 项目不太一样。

第一是 Wiki 模式:它不只是检索完给你一段答案,而是能自动生成结构化的 markdown 页面,把知识整理成一个会自我维护的 Wiki,还带修订历史和回滚。团队文档最大的问题从来不是写不出来,而是写完就烂掉,这个思路算是对症。

WeKnora 自动生成的 Wiki

第二是 技能沙箱:它带一个 skill sandbox runtime,支持 Docker、E2B、Cube 三种后端,Agent 可以在里面跑技能,而不只是做检索。配上 ReACT 编排,能走多步推理,不是一问一答就完事。

技能沙箱运行界面

对国内团队比较友好的是数据源接入:飞书、GitLab、Notion、语雀、RSS 都支持,语雀和飞书这两个在国外项目里基本见不到。LLM 侧接了 20 多家厂商,国内模型不用自己写适配。

其他一些工程化的东西也齐:分块(chunk)可以手动编辑,带修订历史和回滚;工作区有 RBAC 权限,4 级角色;可以生成嵌入网站的 widget;观测接了 Langfuse,链路问题好排查。

部署就是 Docker Compose 三行:

git clone https://github.com/Tencent/WeKnora.git
cd WeKnora
cp .env.example .env
docker compose up -d

起来之后访问 http://localhost 就行。

实用场景

  • 适合想自建企业知识库、又要求数据可控的团队
  • 适合文档散在飞书和语雀、想统一检索的公司
  • 适合需要权限分级的多团队场景

开源地址:https://github.com/Tencent/WeKnora

总结

这期 5 个项目,前两个和第四个凑在一起看挺有意思——i-have-adhd 管 AI 的嘴,context-mode 管 AI 的脑子,方向不同但本质是一回事:AI 的能力已经够用了,现在缺的是约束。 这大概是 2026 年下半年开源社区最明显的一个转向。

各自适合谁:

  • i-have-adhd:受不了 AI 废话的人,装完立刻见效,成本最低的一个
  • VoiceStudio:做配音、有声书、多语种内容,又不想让素材上云的创作者
  • HyperFrames:前端出身想批量做视频的人,或者想让 Agent 自动产片的团队
  • Context Mode:上下文天天被撑爆、token 账单肉疼的重度 Agent 用户
  • WeKnora:要自建企业知识库、数据必须留在自己手里的国内团队

有需要的小伙伴赶紧去 Star ⭐ 收藏起来!

评论

登录后即可发表评论

登录账户

加载评论中...