Skip to main content

格式

Docker 部署已在镜像内安装好视频导出所需的 FFmpeg 依赖。源码部署请先安装带 libass / ass 字幕滤镜的 FFmpeg,例如 macOS 运行 brew install ffmpeg-full && brew unlink ffmpeg 2>/dev/null || true && brew link --overwrite --force ffmpeg-full,Ubuntu / Debian 运行 sudo apt-get update && sudo apt-get install -y ffmpeg libass9

PPTX 导出面板

普通 PPTX 导出会先弹出设置面板,再开始生成文件。可开启「页面切换动画」,并选择淡入淡出、翻页、平移切换、擦除、分割、百叶窗、棋盘、时钟等经典效果;如果同时选择多个效果,导出时会为每页随机使用其中一种。

已导出文件

幻灯片预览页的导出任务面板会列出当前项目已经保存在服务器上的导出文件。你可以在这里重新下载 PPTX、PDF、图片压缩包或讲解视频,也可以删除不再需要的文件以释放磁盘空间。删除前会弹出确认提示;删除后文件会从服务器存储和面板列表中移除。 导出任务的历史记录按项目隔离显示;在某个项目中点击「清除」只会清除当前项目的已完成或失败任务,不会影响其他项目的导出历史。刷新页面后,如果本地恢复的导出任务在后端已经不可用,面板会把它标记为失败并提示重新导出,避免一直停留在「进行中」状态。

讲解视频旁白策略

讲解视频导出会在最后一步弹出单独的配置面板,可在真正开始导出前调整旁白生成策略,而不影响页面内容本身。
  • 可配置演讲者人设、目标受众、演讲基调、核心主题
  • 可配置单页旁白字数范围,适配快节奏短视频或更完整的深度讲解
  • 缺失旁白时可选择由系统自动生成,生成结果会按整套演示文稿保持前后衔接

画面比例

默认 16:9,也可在创建项目时或项目预览页的「项目设置」中更改。支持 16:9、4:3、21:9、1:1、9:16 等多种比例。比例变更后需重新生成图片才会生效。

可编辑 PPTX(Beta)

提取过程保留字号、颜色、加粗样式、文字定位和表格内容,但受限于 OCR 精度和当前模型能力,复杂排版可能存在偏差,与原图效果有出入。 导出前的二级面板可勾选「仅文字层可编辑」,默认关闭。开启后会生成只抹除文字的底图,保留图标、图片、图表等非文字视觉元素,并叠加识别出的可编辑文字框。系统会用 VLM 复核底图文字是否抹除;若仍有文字残留会自动重试,多次失败时选择漏抹最少的底图版本。
配置 BAIDU_API_KEY 可获得最佳提取效果,详见配置说明

图标透明背景

在「项目设置 → 导出设置」中可开启「图标透明背景」,默认开启。开启后,导出可编辑 PPTX 时会对识别为图标的图片调用本地 RMBG-2.0 模型抠图,得到透明背景的 PNG 后再贴入 PPT,避免图标自带的原 PPT 背景在新底色上突兀显示。 仅对识别为图标的元素生效(用 OpenCV flood-fill 在 ROI 上做轻量分类,照片/插图保持原矩形裁剪,避免误处理)。
基于 RMBG-2.0 ONNX 模型本地推理(CPU),首次使用会自动下载约 512MB 模型到 ~/.cache/banana-slides/models/,可通过 RMBG_MODEL_PATH 环境变量指定本地模型文件位置。单张图标抠图失败时会自动回退到原矩形裁剪,不影响导出。
已知限制:原图标自带柔光/光晕,或在彩色幻灯片背景上做了抗锯齿渲染时,抠出的细线条边缘可能仍残留一圈淡色或暗边——因为原图边缘像素本就是”图标颜色 × 原背景色”的混合。纯色背景上的实心图标可以干净抠出,渐变背景上的复杂光晕图标可能需要手动修饰。

选页导出

可选择特定页面导出,无需导出整个演示文稿。在幻灯片预览页开启「多选」,勾选要导出的页面后点击「导出」即可。 导出菜单会按本次选择范围检查图片状态:PPTX、PDF、图片和可编辑 PPTX 需要选中范围内每一页都已生成图片;未选中的草稿页不会阻止已完成页面导出。讲解视频如果范围内还有未配图页面,需要在视频导出面板中明确勾选「包含未配图页面」后,才会用占位帧继续导出。

允许返回半成品

「项目设置 → 导出设置」里的「允许返回半成品」会统一作用于导出链路。
  • 关闭时:只要导出过程中出现关键缺失或失败,例如可编辑 PPTX 提取失败、视频导出缺少旁白文本或无法合成有效语音,任务会立即失败,不再返回不完整结果。
  • 开启时:系统会尽量继续导出。例如视频导出在个别页面没有可用旁白时,会回退为静音片段继续生成最终 MP4。