收起左侧

开源了一个私人 AI 播客工作室:把视频/链接/文稿变成真正能听完的节目

4
回复
195
查看
[ 复制链接 ]

3

主题

3

回帖

0

牛值

江湖小虾

fnOS1.0上线纪念勋章社区上线纪念勋章

一句话:把视频、链接、文稿、会议与课程等多种内容,变成真正能听完的私人播客。

开源地址:https://github.com/vastsa/**Box
协议:LGPL-3.0

1784552121194.webp

先说一个很真实的尴尬

我怀疑你也有过这些时刻:

  • 收藏了技术分享、课程、会议纪要、长文,然后永远「稍后处理」
  • 通勤、洗碗、散步时明明想消化信息,手机里却只剩短视频噪音
  • 想做一档「只给自己听」的节目,又不想半夜对着麦克风录到崩溃
  • 试过各种 AI 播客 demo:声音假、人设死、像在念说明书,两分钟就关了

信息并不缺。
缺的是一种能被你真正吸收的形态。

屏幕时间越来越贵,整块时间越来越碎。
很多内容其实适合「听」,却被锁在「必须坐下来看 / 读」的格式里。

于是我做了 **Box(播匣)


**Box 是什么

**Box 不是又一个「视频转音频」按钮。

它是一台 单用户、可私有部署的 AI 播客工作室

  1. 理解你丢进来的内容
  2. 按你设定的主播人设,重写成口播稿
  3. 用你指定的音色说出来
  4. 附上封面、知识闪卡和听播进度
  5. 变成一档随时可听的私人节目

核心不是格式转换,而是内容消化。

内容进匣,AI 成播。
把「看不完 / 读不完」变成「听得进」。

1784552143420.webp


不限于长视频

很多工具一上来就把自己定成「长视频转播客」。
**Box 从一开始就没这么窄。

你可以丢进去:

  • 视频:本地文件、课程回放、分享录像
  • 链接:文章、文档、公开页面
  • 文稿:笔记、草稿、粘贴文本
  • 会议 / 课程材料:需要二次消化的高密度内容

如果内置路径还不够,还可以通过 Source 插件继续扩展内容源。

一句话:

多源内容 → 可听完的私人口播节目。

  你丢进去的                    **Box 交还给你的
 ─────────────                 ─────────────────
  会议录像 / 纪要               有节奏的口播节目
  课程回放 / 材料    ──AI──▶    可自定义的主播人设
  深度长文 / 文稿               预置 / 描述定制音色
  任意链接(可插件扩展)         封面 · 闪卡 · 听播进度

为什么听起来不像「机器念稿」

市面上不少方案,本质是:

转写字幕 → 直接朗读

问题很明显:

  • 没有开场和收束
  • 重点淹没在细节里
  • 语气平、节奏死
  • 听着像自动文档朗读器

**Box 走的是另一条路:

1. 口播结构重写

AI 会把内容整理成适合「听」的结构:有开场、有重点、有收尾。
不是把原文硬塞进喇叭。

2. 人设你说了算

你可以设定:

  • 主播怎么称呼自己
  • 像产品经理、老师,还是朋友闲聊
  • 节目名、语气调性、开场收尾习惯

全局默认一套,也能给某一集单独改。

3. 音色可定制

支持预置音色,也支持用文字描述你想要的声音气质。
目标不是「能发声」,而是「听起来像有人在讲」。

4. 听完还能带走闪卡

每期不只给你音频,还会提炼知识闪卡。
听过的内容,不会立刻蒸发。

**Box 播放页


两个我特别在意的技术点

如果只是做一个网页 demo,故事到这里就可以结束了。
但我想做的是一个能长期住在你工作流里的系统

1)MCP:让 AI 助手直接操作 **Box

**Box 内置 MCP(Model Context Protocol) 端点。

服务启动后会自动生成长期 Token。你可以在 Cursor / Claude 等客户端里直接调用,例如:

  • create_podcast_from_url
  • create_podcast_from_text
  • list_**s
  • get_**

场景很直接:

在 AI 对话里说一句「把这个链接做成播客」,不用再切回 UI 点来点去。

Cursor 配置示例:

{
  "mcpServers": {
    "**box": {
      "url": "http://localhost:8787/mcp",
      "headers": {
        "Authorization": "Bearer <设置页复制的 Token>"
      }
    }
  }
}

2)Source 插件:内容源可插拔

**Box 不把输入锁死在某一种媒体上

  • 插件默认关闭
  • 放入 storage/plugins/source/ 后扫描启用
  • 插件负责「输入 → 统一素材(SourceArtifact)」
  • 口播、音色、闪卡、封面仍走核心流水线

也就是说:

你扩展的是「内容从哪来」,
不必重写整套播客生成系统。

官方示例包括 source-plugin-echosource-plugin-firecrawl
高风险抓取不会默认塞进主仓,由用户按需安装。

技术差异一句话:

不只是应用,而是 AI 可编排(MCP)+ 源可插拔(Source Plugin) 的私人播客系统。


它适合谁,不适合谁

适合

  • 终身学习者:课程、访谈、发布会、长文太多,只想用碎片时间听重点
  • 创作者 / 研究者:先把多源素材听消化,再决定写什么、剪什么
  • 一人公司 / 独立开发者:把周会、链接、笔记、长文收成自己的「信息广播」
  • 注重隐私的人:内容不出自己的机器,不为平台算法打工

不适合

  • 想做公域播客平台
  • 想做多租户 SaaS
  • 想做在线协作编辑团队工具

**Box 刻意做小、做私、做深。
它站在「帮你更好地消化内容」这一边,而不是「帮你更快地生产公域内容」。


怎么开始

本地三步:

git clone https://github.com/vastsa/**Box.git
cd **box
cp .env.example .env   # 填入你的 API Key
./start.sh             # 打开 http://localhost:5173

Docker(推荐拉预构建镜像):

cp .env.example .env
docker pull ghcr.io/vastsa/**box:latest
./start.sh docker
# 访问 http://localhost:8787

首次进入会引导你完成账号初始化与模型配置。
之后,你的第一期私人播客,只差一条内容。


我真正想解决的,其实是这件事

大多数工具都在帮你:

更快地生产内容。

**Box 更在意:

更好地消化内容。

信息过载的时代,「收藏」几乎没有成本,「吸收」才是稀缺能力。
能被你听完、记住、复用的,才算真正属于你。

所以它不是又一个热闹的 AI demo。它是一个更克制的主张:

  • 输入要宽:视频、链接、文稿、会议、课程都能进
  • 输出要听得完:有人设、有结构、有音色
  • 系统要可扩展:MCP 可编排,插件可扩源
  • 数据要在你手里:单用户私有部署

写在最后

如果你也信这句话:

好内容值得被「听」第二次,而且应该用你喜欢的方式被讲述。

欢迎来看看 **Box:

GitHub:https://github.com/vastsa/**Box

如果这个方向戳中你:

  1. 给仓库一个 ⭐ Star
  2. 提 Issue,说说你最想「播客化」的内容类型
  3. PR 也欢迎,尤其是体验、文案、音色与模型适配

内容进匣,AI 成播。

把那些「稍后处理」的东西,终于处理掉一次。


收藏
送赞
分享

3

主题

3

回帖

0

牛值

江湖小虾

fnOS1.0上线纪念勋章社区上线纪念勋章

昨天 21:57 楼主 显示全部楼层

开源地址:https://github.com/vastsa/Bo keBox/

去掉空格

演示站:https://bo kebox.aiuo.net/

7

主题

48

回帖

0

牛值

初出茅庐

这全程**box

van
人都麻了,应该是B o k e b o x  详情 回复
4 小时前

3

主题

3

回帖

0

牛值

江湖小虾

fnOS1.0上线纪念勋章社区上线纪念勋章

4 小时前 楼主 显示全部楼层

人都麻了,应该是B o k e b o x

0

主题

11

回帖

0

牛值

江湖小虾

需要多少内存?给我docker配置行不?

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则