· TongFlow Team · 公告  · 10 min read

TongFlow 上云了——以及 v0.1.8 之后的全部更新

桌面端变成了 10 MB 的壳,画布跑在云上。Meta 的 SAM、Sapiens2 两套插件上线,音乐从一个按钮扩成一整套节点,官方插件数来到 37 个。这里汇总 v0.1.9 到 v0.2.1 的所有变化。

上一篇汇总停在 v0.1.8。 这段时间最大的变化不是某个模型,而是 TongFlow 的运行方式:桌面端变成了一层薄壳,画布搬到了云上。与此同时,目录也一直在长——Meta 的 SAM 与 Sapiens2 两套插件、一整套音乐节点,还有让一把 API key 直接对应几十个模型的「模型下拉框」。

第一次接触 TongFlow?它是一个开源的多模态 GenAI 工作流工作室:每个 AI 模型都是无限画布上的一个节点。想了解全貌,可以先读产品介绍长文

画布搬到了云上

v0.2.0 把桌面应用换成了云端工作室。app.tongflow.com 用 Google 或微信登录,画布就在那里——插件和执行都由云端托管,本机不用装 Python 运行时,也不用下载模型权重。

安装包还在 Releases 页面,但已经是另一个东西了:约 10 MB 的 Pake(Tauri)外壳,打开就是云端工作室,产物是 TongFlow-mac-universal.dmg(Apple 芯片和 Intel 一个包搞定)和 TongFlow-win-x64.msi。此前那个把 Next.js 服务、SQLite 数据库和 Python 插件运行时打包进去、体积约 200 MB 的 Electron 版本不再发布;已经装了的照常能用,我们不会给它推更新。

完全本地、不需要账号的 TongFlow 并没有消失——那就是自部署。 核心仍然是 GitHub 上的 AGPL-3.0 项目,仍然可以 pnpm start:prod 或用 Docker 跑起来,仍然一分钱不收。

云版定价是每月 $2.99。新账号有 7 天完整功能可用,不用绑卡;之后可以绑卡开启 7 天试用,试用结束按每月 $2.99 计费,随时可取消。我们不卖算力也不卖点数——你用自己的模型服务商 key,按对方的原价直接付给对方。Modal 每月的免费额度就包含真实 GPU 时长,所以算力这一项常常从 $0 开始。

Meta SAM 四件套

四个新的官方 Modal 插件,都基于 Meta 的 Segment Anything 系列。它们的权重是受限模型,需要配一个 Hugging Face token:

  • SAM 3tongflow-modal-sam3)——用文字抠图:描述一个概念,它会把图里所有该概念的实例都抠出来,视频里则是逐帧跟踪。
  • SAM Audiotongflow-modal-sam-audio)——用文字分离声音:降噪、人声分离、任意描述的音轨提取。降噪和音轨分离这两个节点的首个官方实现。
  • SAM 3D Objectstongflow-modal-sam-3d-objects)——单图生成 3D 高斯泼溅。
  • SAM 3D Bodytongflow-modal-sam-3d-body)——单图生成全身人体网格。

Meta Sapiens2,以及视频动捕

v0.2.1 新增了五个由 Sapiens2-1B 权重驱动的节点,全部跑在同一张 Modal L40S 上:

  • 姿态检测——308 个全身关键点(身体、双手、面部),输出在纯黑底上。
  • 人体部位分割——29 类人体解析,输出纯粹的类别色块图。
  • 表面法线——逐像素法线图,背景已遮罩。
  • 人像抠图——直通 alpha 的透明 PNG。
  • 图生 3D 多了一个 Sapiens2 的 pointmap 实现:带颜色的人体点云 GLB。

真正的重头戏是视频动捕:喂一段单目视频,拿回一个绑在 Meta MHR 骨架(Momentum Human Rig,Apache-2.0)上的带动画 3D 人体 GLB。它能直接在模型节点里播放,也能作为带蒙皮骨架导入 Blender。同一个节点有两个方向完全不同的实现——sam-3d-body 靠学习到的先验逐帧回归 MHR(身体、双手,面部通道还在实验阶段),sapiens2 走几何路线(308 关键点姿态加 pointmap 三维抬升,One-Euro 平滑,肢体出画时保持静止姿态)。同一个节点,两套引擎,按片子挑。

有了动画就得有相应的播放器:模型节点现在会自动播放带动画的模型(限 30 fps,移出视口和切到后台标签页时暂停),带播放/暂停控制;初始相机也改成正对模型正面、并把模型铺满画面。

音乐从一个按钮变成一整套

重写后的 tongflow-modal-ace-step 插件(ACE-Step 1.5)把音乐从「一个生成按钮」扩成了六个节点:

  • 局部重绘——只重新生成选定的时间段。
  • 翻唱改编——用一段描述、或者一首参考曲,给歌换个风格。
  • 音轨提取——从 12 种音轨(人声、鼓、贝斯、吉他……)里单独拿出一条。
  • 加一轨——在现有混音之上生成一条新音轨。
  • 补全编曲——把缺的声部填上。
  • 音乐企划——一句话想法 → 歌词、风格标签、BPM、调性和时长。

默认模型换成了官方质量最好的 xl-sft,每个节点上都有模型下拉框,想跑 xl-basexl-turbo 也随时可以。音乐节点还在 v0.1.13 就多了一个可选的参考音频输入:接上一个音频节点,ACE-Step 拿它做风格条件,LeVo 拿它当旋律提示。

旁边还落地了两项相关能力:音频理解audio-describe)——选中一段音频点「描述」,用大白话告诉你曲风、情绪、乐器、人声和事件,Gemini、OpenAI、Agnes、Gemma 4 四家都实现了;以及开放词表声音分离——用自由文本描述一个声音,一次推理同时给你目标声和剩余声两条轨,底层是 SAM Audio。

一把 key,几十个模型

  • APIMarttongflow-api-apimart)——一把 key 打通 7 个节点上的 46 个模型:图像生成与编辑(Z-Image-Turbo、Seedream、Nano Banana Pro、GPT-Image、Imagen 4.0、Qwen Image 2.0、Grok Imagine)、文/图生视频(Kling v3、VEO3.1、Sora 2、Seedance 2.0)、文本生成、Whisper 转写和 TTS。
  • Agnes AItongflow-api-agnes)——一把 key 覆盖 12 个节点:文本生成、拆分与合并、图像理解、图像生成与编辑、多图融合,以及异步的文/图/首尾帧生视频。
  • SenseNova-Visiontongflow-modal-sensenova-vision)——统一视觉模型,横跨 5 个节点;也是第一个把表面法线和抠图带出「人」这个范围的实现:整场景法线、显著物体抠图。
  • LeVoBoogu-Image 也加入了官方目录。

要让这些跑通,契约上加了一件事:逐节点的模型选择。路由型插件声明自己的模型列表,节点就会在插件选择器旁边显示一个模型下拉框,这个选择和 pluginId 一样是顶层字段,一路走过任务创建、数据库、插件信封和工作流导出。不声明模型列表的插件完全不受影响。

一些小改动,但你会用到

  • 50 MB 上传限制取消了——大文件直接拖进画布。
  • 上传失败不再静默——每个文件的错误都会显示出来,不会悄悄少一个。
  • 插件卡片在选择器里显示真实名称、描述和图标,不再是一串 id。
  • 韩语界面上线,加入英文、中文、日文的行列。
  • 节点里的提示词框到了固定高度就滚动,不再把整个节点撑得没完没了。
  • 运行中的节点可以取消(在加载遮罩上),插件也可以卸载了。
  • 企业代理和私有 CA 下能装插件了——现在会读操作系统的信任库,不再报 unable to verify the first certificate
  • Gemini 插件恢复开箱可用——Google 上游下线了 gemini-2.0-flash,默认模型已跟进。
  • 多图生视频接受单张图片;加载工作流后视图会重新自适应。

现在的进度

37 个官方插件,对应契约里的 61 个能力节点——文本、图像、视频、音频、音乐、3D、文档和网页。每一个都是可以拖到画布上、再接给下一个节点的积木。

想直接试试,去 app.tongflow.com 登录即可,不用装任何东西;想把一切留在自己机器上,就从 GitHub 自部署。点个 star 能让更多人看见这个项目;报 bug、提想法、晒作品,都在 Discord

更多模型、更多模态、更多组合方式——继续搭建吧。

TongFlow 正式开源——发布 v0.1.0

TongFlow 现已开源。首个公开版本 v0.1.0 同时带来桌面应用、插件 SDK 和官方插件目录——在一张画布上搭建多模态 GenAI 工作流,所需的一切都在这里。