开源dsh-image-gen:在DeepSeek Harness聊天框直接生图修图


dsh-image-gen 是一个专为 DeepSeek Harness (DSH) 设计的 AI 图像创作插件。它不仅仅是简单的对话生图,而是为 DSH 补齐了从自然语言连续修图、Studio 批量创作、多模型横向对比,到 500+ Prompt 灵感库与本地 ComfyUI 的全流程能力。

四种创作方式

该插件通过四个核心模块覆盖了不同的创作场景:

  • 对话:在聊天框中用自然语言描述需求,即可完成文生图、图生图、多图参考、连续编辑和原位重新生成。例如,你可以直接说“画一张雨夜霓虹街头的赛博朋克猫咪,电影感光线,16:9”。
  • 工作台 (Studio):当你需要更精确的控制时,可以使用工作台进行批量生成、多张参考图输入和高级参数调整。
  • 灵感:内置了 500+ Prompt 案例,支持搜索、筛选、收藏和复制,可以一键带入工作台。
  • 图库:统一管理对话和工作台中保存的图片,支持按工作区隔离、搜索、筛选、收藏、下载和批量管理。

生图插件千千万,只有这个把你的聊天框变成了生图总控台!

DeepSeek Harness 装上 dsh-image-gen 后,你的聊天框直接变成了一个能对话修图、批量出图、横向对比四个模型、还能调用本地 ComfyUI 的生图总控台,全程不用切换任何界面。



DeepSeek 在 2026 年 8 月开源了 Harness 智能体框架。这个框架的核心逻辑是“模型负责思考,Harness 负责执行”。但 Harness 自己不带图像生成能力。dsh-image-gen 就是专门来补这个缺的。它让你在聊天框里打字就能生图、修图、批量出图、让四个模型同时画同一张图做对比,还能连上你本地的 ComfyUI 走私有化工作流。现在问题来了:市面上生图工具那么多,Midjourney 画质好,ComfyUI 控制强,ChatGPT 能对话修图——这个插件凭什么让你专门为它折腾一次安装?

你以为是多了一个生图按钮,其实是把你的聊天框变成了生图总控台

dsh-image-gen 跟所有其他生图工具最根本的区别在于:它不让你去任何新界面。

Midjourney 在 Discord 里,你得在频道里输入 /imagine,然后等机器人回复。ComfyUI 打开是个节点画布,你得拖拽连线。ChatGPT Images 在网页对话框里生图,但你不能批量出图,不能同时让四个模型 PK,更连不上本地的 ComfyUI。

dsh-image-gen 的逻辑是:你已经在 DeepSeek Harness 的聊天框里了。这个聊天框本来就能调用各种工具——联网搜索、代码执行、文件读写。现在多了一个能力:生图。

你不用切页面。不用开新标签。不用在 Discord 和浏览器之间来回跳。所有操作——描述需求、上传参考图、修改上一张图、批量生成、多模型对比——全在同一个聊天流里完成。

这听起来像个小优化。但实际操作中的体验差别是:你从“生图得换个地方”变成了“生图就是聊天的一部分”。

对话生图和连续编辑,不是“能改”而是“改得顺手”

大多数生图工具都支持“改”。但“能改”和“改得顺手”是两码事。

dsh-image-gen 的对话生图走的是“原生工具调用”路线。你给 Agent 发一句“画一张雨夜霓虹街头的赛博朋克猫咪,电影感光线,16:9”,Agent 调用 generate_image,图片直接出现在对话流里。然后你接着发“给这只猫咪戴上一副黑色墨镜”,Agent 调用 edit_image,复用上一张图继续修改。

这里面有两个关键设计。

第一,连续多轮编辑复用的是“当前会话中的图片”——不管是上传的参考图、历史生成的图、还是上一轮编辑的结果。你不用手动选图、不用复制图片 ID、不用重新上传。对话上下文天然就是图片的版本链。你改了三轮,每一轮的图都在对话流里,往前翻就能看到每一步的变化。

第二,生成过程中的状态是可见的。Codex 订阅模式下显示 developing 动画;API Key 模式最多显示三个 provider 发送的 partial images,在动画面板上交叉淡化,最终清晰成 final image。你不是对着空白干等。

这就怪了:市面上能“对话修图”的工具不少,但能让你在同一个对话流里改完一轮又一轮、每轮的图都自动保留在聊天记录里、不用切出去翻文件夹的——你数数有几个?

Studio 批量创作,一次性解决“选哪张”的纠结

对话生图适合快速出图。但当你需要批量产出、对比不同方案的时候,对话模式就慢了——你得一遍遍输入相同的 Prompt,或者让 Agent 重复调用工具。

dsh-image-gen 的工作台(Studio)解决的是这个问题。

在工作台里,你可以一次生成多张候选图。控制 Provider、模型、比例、清晰度。只把满意的结果保存到图库,不满意的直接丢掉。

这跟 ComfyUI 的批量生成有什么不一样?ComfyUI 也能批量,但你要在节点画布里配置。dsh-image-gen 的工作台是界面化的——选 Provider、填 Prompt、调参数、点生成,不需要理解节点连接逻辑。

但事情没那么简单。工作台的真正价值不是“批量”本身,而是“批量 + 筛选 + 留存”在一个闭环里。你生成了八张图,在同一个界面里看完,挑中两张保存,剩下的不占地方。不用在生成文件夹里翻半天文件名。

多模型横向对比,同一个 Prompt 四个模型同时画

这是 dsh-image-gen 最反常识的一个功能。

你输入一组 Prompt 和参考图,它同时调用多个 Provider——Google Gemini、OpenAI Images、ByteDance Seedream、Aliyun DashScope——并发生成,结果并排显示在一张画布里。

为什么要这么做?因为不同模型对同一段文字的理解完全不同。

Gemini 擅长对话式编辑和多图融合。OpenAI 的 gpt-image-2 在多轮对话编辑中保持主体一致性表现突出。Seedream 偏向 campaign scale 的批量产出。DashScope 的通义万相 / Qwen-Image 对中文 Prompt 的理解更准。

你不用一个个试。不用开四个标签页分别输入同样的 Prompt。不用在四个不同的订阅之间切换账号。一个操作,四张图并排出现,直观对比。

这就引出一个问题:你以前选模型是怎么选的?看评测文章?问别人“哪个模型最好”?还是自己一个一个试?dsh-image-gen 的逻辑是:别选了,让它们同时画给你看。

500+ Prompt 灵感库,不让你对着空白输入框发呆

“不知道写什么 Prompt”是生图最大的隐性成本。

dsh-image-gen 内置了 500+ Prompt 案例。支持搜索、筛选、收藏、复制。找到合适的,一键带入工作台。

这不是一个“模板库”那么简单。500 个案例覆盖了不同风格、不同场景、不同模型擅长的方向。你搜“赛博朋克”能看到一堆相关 Prompt,搜“产品摄影”能看到另一堆。看中了直接复制,改几个词就能用。

对于刚上手的人来说,这解决了“第一张图怎么画”的问题。对于老手来说,这是个灵感触发器——你不知道今天想画什么风格,翻一翻案例库,找到感觉了直接开干。

本地 ComfyUI 支持,让私有化工作流进入对话

这是 dsh-image-gen 跟所有纯云端生图插件的最大分水岭。

ComfyUI 是 Stable Diffusion 生态里控制力最强的节点化工作流工具。你可以搭建极其精细的生图流水线——加载特定 Checkpoint、叠加多个 LoRA、控制采样步数和种子、串联多步后处理。

但 ComfyUI 的问题是:它在节点画布里,不在对话里。

dsh-image-gen 的做法是:你把 ComfyUI 的 API Format Workflow JSON 导入插件。然后在对话里让 Agent 按名称选择这个工作流,调用本地 GPU 完成生图。

你的私有化工作流——那些你花了几小时调试出来的节点组合——现在可以通过一句自然语言触发。“用我那个产品图工作流生成一张白色背景的耳机照片。”Agent 听懂,调用,出图。

云端 Provider 不给你的控制力,ComfyUI 给。ComfyUI 不在对话里的痛点,dsh-image-gen 解决。

图库管理,生成结果不是“用完就丢”

很多生图工具的出图逻辑是:生成 → 下载 → 忘记。

dsh-image-gen 内置了图库。所有对话和工作台中生成的图片自动汇总。支持搜索、筛选、收藏、重新生成、下载、批量管理。按工作区隔离存储。

这意味着你的生图历史是可检索的。三周前画的那张“霓虹猫咪”,你不用翻聊天记录翻到手抽筋——在图库里搜“猫咪”就能找到。

而且图库和对话是联动的。你在图库里点“重新生成”,会基于原图重新调用模型。你在图库里收藏一张图,它会在图库里置顶。你在图库里删除一张图,不会删掉聊天记录里的消息。

这种“生成 → 留存 → 检索 → 复用”的闭环,是大多数生图工具缺失的最后一公里。

四个模型随便切,BYOK 模式自己的 Key 自己管

dsh-image-gen 支持的 Provider 分两类。

云端四家:Google Gemini、OpenAI Images / Compatible、ByteDance Seedream(火山方舟)、Aliyun DashScope(通义万相 / Qwen-Image)。

本地一家:ComfyUI。

采用 BYOK(自带 Key)模式。API Key 通过 DSH Credentials 服务保存,设置页不回显明文。Provider、模型、Endpoint 全在 DSH 设置里配置。

你可能会问:为什么不用统一订阅?因为不同的人有不同的 Key 组合。有人只有 OpenAI 的 Key,有人只有火山方舟的,有人全都有。BYOK 让每个人只配置自己有的,不用为用不上的服务买单。

安装过程,三行命令搞定

环境要求:DeepSeek Harness 稳定版本,Node.js ^22.19.0 或 >= 24.0.0。

在 DeepSeek Harness 项目根目录下运行:


pnpm dsh plugin --profile web add dsh-image-gen@latest

也可以直接把这句话发给 DSH 对话中的 Agent:“帮我安装生图插件,在终端执行:pnpm dsh plugin --profile web add dsh-image-gen@latest”。

安装完重启 DSH,进入设置 → 插件 → 插件配置 → 图像生成,选 Provider 填 Key。用 ComfyUI 的话填服务地址、导入 API Format Workflow JSON。

然后就可以在聊天框里打字生图了。

整个流程从零到出第一张图,按正常网速算,五分钟以内。

但有一个问题,目前还没人答得上来

dsh-image-gen 目前支持四种云端 Provider 的多模型对比和 Studio 批量创作。ComfyUI 支持对话生图和编辑,但不支持 Studio 和多模型对比。

这是设计选择还是技术限制?项目文档没有明确说。

如果 ComfyUI 也能进 Studio 和多模型对比——你可以用同一个 Prompt,让 Gemini 画一张、让 OpenAI 画一张、让你本地 ComfyUI 的私有工作流也画一张,四张并排对比——那这个工具的价值会再翻一倍。

但 ComfyUI 的工作流是节点化的,每个工作流的输入输出结构不同。怎么把“一个自然语言 Prompt”翻译成“不同 ComfyUI 工作流都能理解的输入”?这个问题目前没有现成答案。

所以现状是:云端模型可以横向对比,本地工作流只能单独调用。这个缺口什么时候补上、怎么补上,是 dsh-image-gen 下一步最值得关注的点。

而你,在等待答案的这段时间里,已经可以在聊天框里直接画出一张赛博朋克猫咪了。