开源hybrid-deep-research:纯提示词驱动的深度研究系统


hybrid-deep-research 是一个专为 AI 智能体Hermes设计的多轮深度研究流水线(Pipeline)。它的核心设计理念非常独特:纯提示词驱动(Prompt-only)——不依赖任何 Python 代码、框架或第三方库,所有逻辑都通过精心设计的提示词(Prompts)来实现。

大模型正在自己研究自己——一个不需要代码的AI深度研究流水线

你让AI帮你查点东西,它转头派出八个“研究员”,分头翻网页、刷Reddit、扒GitHub,最后交给你一份带引用的研究报告。整个过程不需要你写一行Python,不需要搭任何框架,甚至不需要安装依赖包。你只负责提问,剩下的全交给提示词。

这个叫hybrid-deep-research的开源项目,把“让AI做研究”这件事拆成了大概七个步骤:

  • 先生成研究简报,
  • 再把问题拆成子话题,
  • 然后同时派出多个调查员去不同渠道搜集信息,
  • 接着让评论员过滤低质量内容,
  • 检查信息缺口,
  • 决定继续挖还是开始写报告,
  • 最后合成报告并用curl命令逐条验证每一个引用链接是否还活着。

整个过程全部靠提示词驱动,没有任何传统意义上的“程序逻辑”。

你没看错——这个流水线里没有if-else,没有for循环,没有数据库,没有API封装层。有的只是一段又一段写给大模型看的指令,让大模型扮演不同角色,自己调度自己,自己检查自己,自己修正自己。

这听起来像是把AI当人用。更准确地说,是在用提示词搭建一个“虚拟组织”。用一句话指挥AI跑完一整个研究团队——不写代码,只靠提示词

把“做研究”这件事拆成了八个角色

hybrid-deep-research这个开源项目把“做研究”这件事拆成了八个角色——有负责拆解问题的总监,有分头查资料的调查员,有专门挑毛病的评论员,有汇总写报告的合成师,还有最后逐个检查引用链接的验证官。

整个流程跑完,你只需要做一件事:提问。

这八个角色共享同一个大模型:同一个AI,一会儿当总监,一会儿当调查员,一会儿当评论员,一会儿当合成师——切换的不是代码逻辑,是一段又一段写给AI看的角色描述。

换句话说,这个项目用573行提示词搭了一座虚拟研究所。里面没有if-else,没有for循环,没有API封装层,只有一个大模型在不同角色之间来回切换。所有流程控制、质量把控、冲突裁决,全部靠提示词来完成。

这完全颠覆了我们对“写程序”的认知。传统观念里,想让AI完成复杂任务就得写代码——调接口、搭流程、处理异常、管理状态。

但这个项目直接把这条默认规则掀了:只要提示词写得足够精细,大模型自己就能完成多智能体协作的全部流程。

最反直觉的地方在于:这不只是在“教AI做事”,这是在“用自然语言写程序”。

八个人格共用一颗大脑——同一个模型怎么同时当总监又当调查员

同一个大模型,既能把一个模糊的问题拆成三到五个子话题,又能分头去执行搜索任务;既能严格审查每一条信息的质量,又能把零散发现整合成一篇结构完整的报告。这听起来像精神分裂,但项目就是这么设计的。

打开项目源码里的角色定义文件,你会看到八个完整的人格设定。

第一个角色叫“简报生成器”,它的任务是判断用户问题属于哪个类别:是“产品推荐”还是“对比分析”?是“操作指南”还是“事实核查”?判断完了再设定研究深度——表面模式跑一轮、中等模式跑两轮、穷尽模式跑四轮。

判断完类别之后,“研究总监”上场。它把大问题拆成子话题,再给每个子话题分配具体的查询语句和研究目标。第一轮先发四条宽泛的查询,第二轮缩减到两条,第三轮只剩一条。广度逐轮减半,从扫面到聚焦。每条查询都附带一个“研究目标”——“你为什么要搜这个、你期望找到什么、找到了怎么用”。

然后八个调查员同时出发。有的去网页搜,有的去Reddit翻帖子,有的去Hacker News看讨论,有的去扒GitHub的星标数和最近提交记录。每个调查员拿到的指令都一样:把发现压缩到200词以内再带回来。超过200词的内容直接扔掉,只保留数字、直接引语和核心主张。

为什么要卡200词?大模型的上下文窗口再大也是有限的,不加控制的话,几个调查员各自拖回来几万字的网页内容,上下文瞬间爆掉。200词的硬上限倒逼调查员做信息提纯——你只能带回来最精华的东西。

信息汇合之后,“评论员”开始干活。这个角色专门负责挑毛病:没有URL的发现直接扔掉,URL打不开的扔掉,超出时间范围的扔掉,内部自相矛盾的扔掉。如果是官方文档标签但链接指向个人博客,降级处理。如果是单一来源且带有强烈主观色彩的结论,置信度从“高”降到“低”。评论员不生产新内容,只负责过滤和标记。

过滤完,“研究总监”再次上场做缺口检查:所有子话题都有至少两个独立来源了吗?关键矛盾解决了吗?社交媒体和传统网页的发现能交叉验证吗?如果没有,继续下一轮调查;如果够了,进入合成阶段。

合成阶段,“合成师”把所有发现整合成一份带引用的报告。它遵循一套权重规则:官方文档优先级最高(1.0),新闻次之(0.7),分析报告和代码库第三(0.6),博客第四(0.4),社交帖子最低(0.3)。如果来源冲突,权重高的说了算。如果权重相同,两边都摆出来,注明矛盾。

最后,“验证官”上场。这个角色不靠大模型判断,而是直接调用curl命令逐条检查报告里每一个引用链接——404就标记[URL_DEAD],超时就标记[URL_TIMEOUT]。最多重试三次,三次不过就带着标注发布。

整个流程跑下来,一份1500多字的报告带着二十多个引用链接出现在你面前。你只做了两件事:提问,等结果。

当“写代码”变成“写作文”——提示词正在重新定义程序

这个项目最反常识的点不在技术层面,而在认知层面:它把“写代码”这件事从“让AI干活”的默认路径里踢了出去。

过去几年,大模型应用开发的主流叙事一直是“框架化”——LangGraph、CrewAI、AutoGen这些框架帮你管理多智能体协作,你写Python代码来定义流程、状态、工具调用。但hybrid-deep-research走了一条完全相反的路:不用框架,不写代码,所有逻辑塞进提示词里。

这不是在偷懒,这是在重新定义“什么是程序”。

传统程序是给计算机执行的指令序列,精确、确定、不容二义。提示词是给大模型看的指令,模糊、开放、依赖理解。但当一个提示词足够长、足够具体、足够结构化的时候,它和程序之间的边界开始模糊。

你看“研究总监”的提示词:输入是研究简报,输出是JSON格式的子话题和查询列表。这不就是函数的输入输出定义吗?再看“评论员”的提示词:逐条检查URL是否存在、日期是否在时间范围内、可信度标签是否合理。这不就是单元测试吗?“验证官”直接调用curl做确定性检查——这已经是货真价实的代码行为了。

所以这个项目的真正价值不是“省了写代码”,而是揭示了提示词工程的一个深层可能性:提示词不只是“给AI的指令”,它可以成为“可执行的规范”。

你写好一份详细的操作手册,大模型照着手册一步步执行,每一步都产出结构化数据,下一步拿着上一步的数据继续推进。整个流程跑通了,你得到一份研究报告;跑崩了,某个环节的产出不符合预期格式,下一步的大模型读不懂,流程就卡住。

这种“卡住”本身就是一个信号——它在告诉你:你的提示词还不够精确,你的规范还不够严谨。而修正的方式不是改代码、调参数,是改文字、调表述。

从这个角度看,提示词工程师和传统程序员之间的界限也在模糊:前者用自然语言写“程序”;后者用编程语言写“程序”。区别在于,自然语言写的“程序”运行在一个会“理解”的引擎上,它允许一定程度的模糊和灵活;编程语言写的程序运行在一个只认精确语法的引擎上,一个分号错了就编译不过。

但这两种“程序”有一个共同点:它们都在定义流程、约束行为、管理状态、处理异常。

大模型发展到现在这个阶段,很多人还在争论“提示词工程是不是一门正经技术”。hybrid-deep-research提供了一个非常硬的回答:当一个提示词文档长达数百行、定义八个角色、覆盖七个阶段、包含错误处理、速率限制、降级策略、状态持久化和崩溃恢复的时候,它已经不是“一段话”了,它是一份完整的系统设计文档。

这份文档不描述系统应该长什么样,它描述的是:让一个大模型扮演八个不同的角色,这些角色之间如何交接、如何制衡、如何容错。

同一个大脑切换八种人格——提示词如何“调制”AI的行为模式

项目里有一个细节特别值得玩味:所有角色共享同一个大模型。同一个模型,一会儿当总监分解任务,一会儿当调查员搜网页,一会儿当评论员挑毛病,一会儿当合成师写报告,一会儿当验证官查链接。

同一个大脑,切换不同的“人设”做不同的事。

这不就是人类团队的工作方式吗?一个人早上开会当决策者,上午写代码当工程师,下午审PR当代码审查员,晚上写文档当技术作家。切换的是角色,不变的是同一个认知系统。

大模型在这套流水线里做的事情,本质上是在模仿这种“角色切换”能力。给它一段角色描述,它就能进入对应的思维模式——严格一点的当评论员,发散一点的当调查员,结构化一点的当合成师。同一个模型参数,不同的提示词前缀,输出风格和判断标准截然不同。

这说明了一个问题:大模型的“智能”不是固定的,它高度依赖你给它设定的“语境”。你把它当严格的质量检查员用,它就变得挑剔;你把它当创意收集者用,它就变得开放。同一套神经网络,在不同提示词的“调制”下展现出完全不同的行为模式。

这种“调制”比训练和微调便宜太多了。训练一个模型要几千万美元,写好一段提示词只需要几个小时思考和迭代。hybrid-deep-research用几百行提示词撬动了一个完整的研究流水线——这个杠杆比大多数人想象的要长得多。

当然,这套方案也有明显的天花板。

所有角色共享同一个模型意味着:如果模型本身能力不够,再多角色切换也没用。评论员再严格也受限于模型的理解能力,合成师再结构化也受限于模型的推理能力。这就像一家公司所有岗位都由同一个人兼任——这个人再全能也有上限。

另外,纯提示词驱动的流程缺乏传统程序的那种“确定性”。同样的输入,模型每次跑出来的结果可能略有不同。这在某些场景下是优点(灵活性、创造性),在某些场景下是致命缺陷(需要精确输出的场合)。

还有Reddit这类平台的访问问题。没有配置cookies的话,Reddit的JSON接口会返回403 Cloudflare错误。项目里写了降级方案——退回到site:reddit.com的网页搜索——但降级后的结果质量明显下降。这种“平台壁垒”不是提示词能解决的问题,它需要真实的工程手段——配置cookies、处理反爬、管理认证。

但话说回来,这些限制恰恰说明了这个项目的诚实之处。它没有试图用提示词解决所有问题——URL验证用curl,GitHub API调用用curl,Reddit访问用cookies.txt。提示词负责的是“决策和判断”层面的工作,具体执行层面的“确定性操作”交给命令行工具。

这种分工很聪明:让大模型做它擅长的事(理解、判断、生成),让命令行做它擅长的事(精确、稳定、可重复)。两者结合,比纯代码方案更灵活,比纯提示词方案更可靠。

从“对话”到“委托”——你不再跟AI聊天,你在给它派活

有人可能会问:这跟直接让大模型联网搜索有什么区别?

区别在于“组织性”。直接让大模型联网搜索,它给你的是单次查询的结果汇总。hybrid-deep-research做的是多轮、多源、带校验的深度挖掘。第一轮扫面,第二轮聚焦,第三轮深挖,第四轮补缺。每一轮都带着上一轮的缺口和追问出发。每一轮的发现都要经过评论员的质量过滤才能进入合成阶段。每一个引用链接都要被curl验证过才允许出现在最终报告里。

这相当于给大模型配了一整套“研究管理体系”:有计划、有执行、有审核、有复核、有纠错。单次联网搜索是“问一句答一句”,这个流水线是“问一句,派出一个团队调研一整天,回来交报告”。

所以这个项目最值得关注的不只是技术方案本身,更是它背后那个正在发生的趋势:大模型正在从“对话工具”变成“行动主体”。

以前你用AI是聊天——你问,它答,一轮结束。现在你用AI是“指派任务”——你说“帮我研究一下某某事情”,它自己规划、自己执行、自己检查、自己交付。你不需要知道中间过程,你只看最终结果。

这种从“对话”到“委托”的转变,正在重新定义人机协作的边界。

过去你要做一个研究项目,得自己定方向、拆问题、找资料、交叉验证、写报告。现在你把这些问题一股脑扔给一个提示词驱动的流水线,它在后台默默跑完所有步骤,半小时后把一份带引用的报告放在你桌上。

你付出的不再是“劳动”,而是“判断”——判断这个问题值不值得研究,判断这份报告质量够不够高,判断下一步往哪个方向深入。

这像不像你在带一个实习生?你布置任务,他执行;你检查结果,他修正;你给方向,他落实。区别在于,这个“实习生”不需要培训、不需要工资、不抱怨、不摸鱼,而且可以同时扮演八个角色。

当然,它也会犯错。它会误解你的意图,会漏掉关键信息,会被低质量来源误导,会在复杂问题上显得力不从心。但它的成长速度是任何人类实习生都比不了的——下个版本的模型一发布,它的“智商”就跳一个台阶,而你不需要重新培训它。

这大概是提示词驱动方案最迷人的地方:你写好的那几百行提示词,随着大模型本身的进化,会自动变得“更聪明”。同样的流程描述,早期模型跑出来是及格水平,新模型跑出来是良好,再新一点的模型可能跑出优秀。你不需要改一个字,输出质量自己往上涨。

这种“不动代码只升级引擎”的体验,在传统软件开发中几乎不存在。你写的Python代码不会因为Python解释器升级而自动变得更好——它该是什么样还是什么样。但提示词会,因为提示词的质量不仅取决于文本本身,还取决于“阅读”它的那个引擎的理解能力。

所以hybrid-deep-research这个项目,表面上看是一个研究工具,深层看是一个关于“未来软件长什么样”的隐喻。

hybrid-deep-research提供了一个非常具体的参照物:看,这就是几百行提示词能做到的事。它不完美,有天花板,有各种边界情况处理不好。但它确实在工作,确实在产出有价值的结果,确实在重新定义“用AI做事”的方式。

你可以不喜欢这种方式,觉得它不够工程化、不够确定、不够可控。但你不能否认它在做一件传统代码很难做到的事:用不到一千行的自然语言,构建了一个多角色、多轮次、带质量控制的深度研究系统。

这件事本身,就是对“什么是程序”这个问题的重新提问。

而答案,可能正在被一行一行地写进提示词里。

一个不需要写代码的AI研究团队,正在用纯提示词颠覆你对“编程”的全部认知。

总的来说,hybrid-deep-research 是一个非常纯粹且设计精巧的“元”项目,它展示了如何仅通过提示词工程,就构建出一个功能完备、鲁棒的多智能体深度研究系统。