安装

一行命令,
装进你的运行时。

1拿仓库、装技能

git clone https://github.com/rocsgh/ppt-zen
cd ppt-zen
./install.sh claude --global      # see the matrix below for your runtime
运行时命令装到哪触发方式
Claude Code./install.sh claude [--global].claude/skills/ppt-zen//ppt-zen or just ask for a deck
OpenClaw./install.sh openclaw [--global].openclaw/skills/ppt-zen/直接说要做 deck
Hermes./install.sh hermes [--global].hermes/skills/ppt-zen/直接说要做 deck
Codex CLI./install.sh codex [--global]AGENTS.md / ~/.codex/AGENTS.md被动——自动读取
Cursor./install.sh cursor.cursor/rules/ppt-zen.mdc被动——自动生效
Windsurf./install.sh windsurf.windsurf/rules/ppt-zen.md被动——自动生效
GitHub Copilot./install.sh copilot.github/instructions/被动——自动生效
全部./install.sh all以上全部

技能安装是自包含的(SKILL.md + references + styles + scripts + examples + styles.json)。完全没有 skill 系统?把 SKILL.md 整段贴进会话当上下文即可。

2接上图像模型

每一页都是生成的图。如果你的 agent 本身带图像工具,什么都不用配——skill 直接用它。否则把内置脚本指向实现了 OpenAI /images/generations 接口的任意端点(接受 {model, prompt, size, n}、返回 b64_jsonurl——只兼容 chat 的"兼容"网关不算):

cp .env.example .env                  # IMAGE_API_BASE_URL / IMAGE_API_KEY / IMAGE_MODEL / IMAGE_SIZE
python3 scripts/gen_image.py --check  # verify before a long run

PPT-Zen 不带任何 key、不绑定任何模型——判断是开源的,像素是你自己的。

3做一套片——你实际要说的话

在任何项目里打开你的 agent,直接说话。一句话就能开始;剩下的它来判断,绝不会反问你版式问题:

"Make me a 10-page pitch deck about <your project> with ppt-zen, in the Portolan style."
"Design a keynote about our Q3 results — pick a material that fits."   # 它自己选
"One slide only: '23 minutes to refocus', make it land."               # 单页也行

agent 会先写 plan.md(页 · 详略 · 器物 · 逐字文案 · 风格)——想过目就过目——然后逐页出图到 slides/。之后对着页迭代:

"Regenerate page 6 — the numbers feel cramped."
"Swap the whole deck to the Kintsugi material."      # 同一计划,换个世界
"Page 4's device isn't readable, try a funnel."

把真实数据喂给它。附上提纲 / 指标 / 链接——真数字会上片;缺的只会显示 [TO CONFIRM] 占位,绝不编造。页面都校对干净之后:

pip install python-pptx
python3 scripts/assemble_pptx.py slides/ deck.pptx

?FAQ

哪些图像模型能用?

任何走 OpenAI 兼容 /images/generations 路由的——OpenAI 的 gpt-image 系、各类中转、网关。画廊样张用 gpt-image 级模型在 1536×1024 生成。非 16:9 的输出会在拼装时居中裁切,所以 prompt 会让关键内容避开上下约 8%。

拼出来的 .pptx 能编辑吗?

它是图片型的:每页一整张满幅图。放映、导 PDF、导入 Keynote/Google Slides 都行——但文字不可编辑。改错字 = 重出那一页(skill 支持单页重出)。

它会替我编数字吗?

不会——这是硬规则。事实只来自你的输入;缺的会显示成 [TO CONFIRM] 占位。skill 只定版式,绝不编事实。

我能加自己的风格吗?

能——复制 styles/_template/,填好 STYLE.md(材质配方 + 一张样张),提 PR。画廊和 styles.json 自动重建。风格是 CC-BY-4.0,贡献走 DCO。

跑一次要花多少钱?

取决于你的图像端点收费——10 页 = 10 张图,外加你选择的单页重试。量级参考(OpenAI gpt-image 官方价,2026 年中):1536×1024 每张约 $0.06–0.25(看质量档),首轮 10 页约 $1–3;含逐页校对预留 20–40 分钟。以你自己端点的价格为准。

打开 GitHub 先看一套成片