德国程序员家里的两台显卡,开了个永远不下线的AI电视台!
你随手敲的一行弹幕,45秒后变成15秒视频,在同一间直播间播出!
SlopTV(垃圾电视台)用两块RTX 5090显卡在本地跑MiniMax H3视频模型,靠gpt-5.6-luna把YouTube(油管)直播弹幕改写成剧本,全天候生成15秒AI短视频,每天电费约10美元。显存账本、API配额、提示词实验、推流时钟,全部压在这台机器的工程细节里。
弹幕刚进来,出去就成了视频
2026年8月底,德国一台机箱里插着两块RTX 5090显卡(英伟达消费级旗舰卡)的家用服务器,办成了一条永不断更的电视频道,频道名叫SlopTV,翻译过来就是垃圾电视台。它的节目单上只有一类内容:AI生成的胡闹短视频,行话叫AI slop,指量大管饱、没人当真的电子榨菜。
先交代这条流水线怎么转。直播间里,观众一边看片一边刷屏打字,这些滚动评论是电视台唯一的选题来源。有人敲一句"capybara dj underwater rave",水豚、DJ、水下、锐舞派对,四个互不相干的词,语法稀碎。一个语言模型接手,把这句话吹胀成一篇三五百字的结构化分镜剧本,标注好每个镜头的时间码、台词和声效。然后视频模型开工,用大约90秒渲染出15秒成片。最后一步最有嚼头:成片原路推回观众刚才打字的那个直播间播出,观众对着刚播的片子继续吐槽,新吐槽又变成新片子。蛇咬住了自己的尾巴,而且越吃越饿。
这个玩法有前辈。荷兰开发者levelsio此前办过同类频道infiniteslop,模型调用走云端API,账单由AI推理公司fal.ai的资助兜着。SlopTV的开发者没拿到任何赞助,权重文件下到本地,电费自己掏,一天10美元,一个月约300美元。同样是24小时吐内容的机器,一台花别人的钱,一台花自家电表上的字。
真正让人停下来想的,是这套系统跑通的时间点。本地开源视频模型加两块消费级显卡,加一个不算大的语言模型,就撑住了一条直播频道,单位成本已经跌到业余爱好的量级,门槛从"拿融资"变成了"会装软件"。对吗?往下看会更奇怪,因为这条流水线里最硬的骨头,全在跟AI无关的地方。
分辨率越高,模型越不听话
玩视频生成的人默认一条常识:分辨率越高,画质越好,SlopTV偏要反着来。它把每条片子渲染成352x608的竖屏,约0.21兆像素,一块10多年前的手机屏幕都嫌寒碜,然后再放大到1080x1920推出去。开发者自己的说法很坦率:放大完像垃圾,垃圾就是这个牌子的定位!
按理说这是穷造成的妥协,两块显卡抠抠搜搜,算力不够才降规格。可实测数据偏要反着走。社区把MiniMax H3(稀宇科技开源的视频生成大模型)在不同分辨率下测了个遍,发现模型最听剧本话的区间在352p到416p之间,一旦推到768p,它就开始无视镜头指令,你说给特写,它自顾自拍全景,你说人物站左边,它把人塞进画面正中。低分辨率换来的不是省算力,是控制权。0.21兆像素的糊,是这条流水线里性价比最高的一笔开销。
省下来的时间拿去换吞吐。H3属于扩散模型,这类架构从一团纯噪声出发,反复去噪,一步步收敛出画面,每一轮都要把几十亿参数完整过一遍,所以去噪步数直接等于时间。SlopTV贴着模型加了一块8步版的turbo LoRA(微调参数补丁),把原本二十来步的工序压到8步,一块卡90秒出货,两块卡轮转,观众平均等45秒就能看到自己的弹幕变成片子。对照一下原版配置:不加补丁、跑20步、按720p生成,一条片子要20分钟,是快跑模式的十几倍,谁会在直播间等这种东西。
画质、步数、时长,三个旋钮全拧向"快点出片"这一头,这个取舍很视频平台,不像实验室。而下一个翻车点藏得更深,在显卡的钱包里。
显存差两GB,先算一笔搬运账
SlopTV的模型文件一共占66GB硬盘,装进显卡的却只有两坨。一坨是扩散主干,负责把噪声磨成画面,用int8(8位整数)量化加剪枝压到19.5GB;另一坨是文本编码器,先把剧本翻译成模型听得懂的向量,用nvfp4(英伟达的4位浮点格式)压到14.6GB。量化,说白了就是拿精度换空间,把每个数字占的字节砍到几分之一。
账算到这儿就崩了:32GB的RTX 5090装不下34.1GB的现役阵容,缺口2GB左右。按老习惯,要么再买卡,要么接着往死里压模型。这台机器走了第三条路:ComfyUI(节点式AI生成工作台)的显存卸载功能,把暂时用不上的参数块扔进系统内存,轮到用时再搬回显卡。2GB的窟窿,靠来回搬运填上,代价是多花电,搬运数据不要钱,但费时间。
整机的电费单比想象中体面。两块卡各吃600瓦上下,整机1.5千瓦,德国电价约每度30美分,一天烧10美元,一个月300美元。很多人一听"显卡24小时渲染视频"就脑补出每月两千美元的电表,实际数字差了二十倍。这台机器还有个更魔幻的注脚:两张卡是硬件涨价潮之前按2200美元一张买进来的,行情如今接近5000美元,也就是说显卡涨价带来的账面收益,已经把一年电费赚回来了。用电的生意还没细算,囤硬件的先赢了。
省电的另一面是省人。凌晨四五点,直播间空无一人,两块卡没闲着,没有弹幕时,语言模型会按指令自己编选题、自己写剧本、自己渲染。真金白银的电费,买的是机器永不停手,哪怕台下没有人。
掐住脖子的配额:半小时烧光一天额度
抓直播弹幕,是整条流水线离AI最远、翻车最多的环节。视频平台的官方接口(Data API v3)按配额计费,每天10000单位,没有付费加量选项。最直观的抓取办法是轮询:客户端每隔一会儿问一次"有新评论吗"。可查一次评论列表要5单位,热络的直播间每秒就得问一次,一天需要十几万次调用,配额撑不到午饭时间,实测约30分钟,一天的额度烧得干干净净。
出路藏在一条没人走的接口上:gRPC(谷歌自家的远程调用协议,支持服务器主动往客户端推数据)的streamList端点。连接建立后,服务器排着队往下推消息,配额几乎不动。坑在于工程细节。谷歌公开的协议定义文件(proto)嵌在教程网页的代码块里,原样抠出来编译不过,缺一句时长类型的引入声明,得自己补上再拿工具生成客户端代码。上线之后又有新花样:服务器隔几秒就主动掐一次空闲连接,这不是故障,是常规操作,所以重连循环才是主循环,断线后带着续传标记接着要消息,首包还会重放最近的旧评论,客户端按消息ID去重。访问令牌一小时到期,循环里顺手刷新。
OAuth授权那里还埋着一颗雷。应用挂在谷歌云控制台"测试中"状态时,刷新令牌7天过期,24小时直播每周一早醒来一次,谁也受不了。解法透着黑色幽默:把应用发布成"生产中"但不做验证,令牌就永久有效,代价只是授权那一刻,浏览器弹一页Google没核实此应用的橙色警告,点个继续就行。验证申请?控制台天天催,不用理。
这一整段没有出现过一次模型推理,却处处是生死题。看完这段你会明白,AI直播频道的前身,是一台被接口配额追着打的水管工机器。
教小模型写剧本,规矩多过样例
把弹幕改写成H3剧本的语言模型,选的是gpt-5.6-luna,便宜、够快、个头小。个头小,脾气就怪,第一版提示词(写给模型的岗位说明书)就栽在这上面。初稿按教科书来:讲清规则,再附一篇范文。结果每生成十篇剧本,八九篇的布景、角色、色调都跟那篇范文神似,观众要的水豚派对,长出了范文里同款霓虹灯。模型把例子背下来了,连例子要表达的意思一起吞了。
重写的版本釜底抽薪:整份提示词一个字面例子都没有,全是祈使句规则和[占位符],连"别照抄本提示里的描写"都写成明文禁令。训练一个不爱动脑的学生,讲道理比给参考答案管用,遛狗也讲究这个。这就怪了,行业里人人都夸少样本示例是提示词工程的压舱石,轮到一个5毛一颗脑子的小模型,示例反而成了污染源,规矩的适配对象是具体型号,没有通用真理。
格式这块是硬约束。开源权重只吃H3官方训练的那种结构化剧本:三个带标签的字段管整体描述、整体声场、非剧情音乐,正文按[镜头N]加时间码切段,台词塞进语言标签。云端付费API会悄悄帮你把大白话预处理成这个格式,开源权重不会,喂自由文本就还你一部不知所云的片子。细节规矩全靠踩坑堆出来:描述低于300字,成片自动滑向素材库水准,目标定在300到450字;每个镜头至少3秒,切点必须带标签,光秃秃的时间码会让模型手滑;对白是最弱的通道,最多两句短句、绝不跨切点,对口型一塌糊涂是社区公论;人脸保持在Medium镜别以内,远景糊脸,特写手部穿帮,发牌、切菜这类精细动作直接多出第六根指头;H3没有负面提示词字段,就用一句固定收尾凑数,不许有斑点、不许漂浮噪点、不许多余肢体、不许人脸扭曲。
合规策略反而最有意思,原则是疏导优先于枪毙。版权从来不是拒稿理由:有观众点名要史莱克配《虎眼》主题曲,模型交出来的剧本是无名绿怪人配一段原创80年代训练神曲,味儿全对,名字全无。直接枪毙的只有一类:整条弹幕的全部意义就是违规,比如指名道姓诅咒同事,那就没什么可导的。删掉违规内容,评论就成立了;保留违规内容,频道就没了。视频平台的执法很干脆:一次违规警告,直播功能停14天,三次直接销号。这条频道能活多久,答案就押在这份提示词的尺度上。
一个目录当合同,一台机器不许断流
SlopTV的架构图短得可疑:
YouTube live chat ──► generate.py ──► LLM ──► GPU workers (ComfyUI + MiniMax H3)
│
▼
pool/*.mp4
│
stream.py ◄─────────────────────────────────────────┘
└──► decode ─► upscale to 1080x1920 ─► x264/AAC ─► RTMP ─► YouTube
生产端叫generate.py,把渲染好的mp4扔进一个叫pool的文件夹;播放端叫stream.py,扫这个文件夹,按时间序播没播过的,播完就在池子里随机抽旧片垫档期。两个进程的全部交情就是这个目录,没有数据库,没有消息队列,没有RPC,一边崩了重启,另一边毫无知觉。渲染进程先往暂存目录写,写完一次rename()原子改名进池,播放端永远见不到半截文件。用目录当合同,粗糙,但粗糙到砸不烂。
播放端的全部设计服务于两个字:不断。冷场从哪来的?从每条片子之间拆了重建的编码器和推流连接来的。所以整台机器只开一个FLV容器、一对x264加AAC编码器,开机即开,永不关闭;时间戳对着自造时钟打,这个时钟跨片段、跨断线都不归零,RTMP(直播推流协议)断了就重连,平台端看到的还是同一场直播在继续。解码线程在播当前这条的时候,已经把下一条读进内存并放大好;音频按每条视频的精确时长补静音或裁掉,声画不同步攒不起偏差,按周计的长跑也不会漂。362帧对15.083秒,24帧的鼓点从头敲到尾。
这套"不断流"哲学最冷的注脚在深夜。没有弹幕时,语言模型收到一个特殊占位符:自己编。凌晨四点的水豚在跳没有人点名的舞,观众数在计数器上趴着不动,显卡照转不误。一条评论的意义,由它在这间直播间里被拿来干什么决定,哪怕干完之后没有任何人记得它。电视台不再需要观众,它只需要电流。
十美元一天的电视台,先量出行业软肋
把SlopTV放回行业坐标系里,才能看出它扎在哪。infiniteslop靠云端API和厂商补贴活着,本质是一场限时烟花,赞助烧完,频道熄火;SlopTV把全部成本摊在电表上,每天10美元,理论上可以烧到显卡进坟。前者演示"给钱能做多炫",后者演示"不给钱能做多久",后者才是让平台睡不着觉的那种。
观众的生理反应比商业分析诚实。第一批观众里,有人盯了一分钟就关掉,说头疼、发晕;也有人承认看入了迷,两小时没挪窝;还有人下了个判断:百分百生成的烂,比百分之九十生成的烂更纯粹。三种反应摆在一起,恰恰是短视频时代已经给过全世界的答案,区别只是这台机器把剂量拧到无限,而且免费续杯。
工程圈对它的态度同样分裂。有人替它省算力:用4B的文本编码器配clip投影,模型常驻显存,不必来回搬运;有人替它省钱:为什么不砍到10秒一条,压低等待;有人担心合规:让弹幕里所有话都进模型太危险,建议只响应感叹号开头的生成指令。这些建议大多有道理,而机器当时只回应了一个数字:队列积压约30条。一位观众等了自己提的词15分钟没见着,深夜时段弹幕每5分钟来一条,机器吐片的速度远远跑赢人打字的手速,产能从来不是瓶颈,注意力才是。有观众提议干脆把各家攒机人的显卡pool起来分布式代工,听着像模像样,可直播是实时业务,跨国送显卡快递的时间,够这台机器出上百条片子。
要是你打算照着这套东西攒一台自己的永动频道,三件事比选模型重要:先把失败接口设计好,用一个目录加原子改名喂饱播放端,别急着上消息队列;把成本算到每单位时间,配额每秒烧多少、显存差几个GB、电费一天几号数,账不平就动手,烧的是纯钞票;给小模型写提示词时收好你的范文,只留规则和占位符,然后按目标型号逐条回归测试。
三根没收线的线头
SlopTV仓库里留着一摞设计记录文件(RFC),白纸黑字挂着没划掉的疑问。
第一个:streamList这条gRPC连接到底能活几天?验证程序只跑了几分钟,经历几十次断线重连,消息不丢不重;生产机器连着播了好几周,两个事实还没对上账,分钟级的胜利证明不了多日级的稳定。
第二个:非剧情音乐字段写着N/A时,仍有约两成的片子偷偷配上了背景音乐,社区统计出来的这个漏音率,作者选择咽下去,不修、不弃、不重roll,播就完了。
第三个最邪门。提示词里明明写了"切点节奏要变化",实测成片的时间码却扎堆落在6秒和11秒,两次干跑都是这个位置,像模型骨头里嵌了一只看不见的节拍器。作者试过在提示词里塞模板强行纠偏,又怕抹掉那点心气儿,决定等真实渲染堆多了再说。截至现在,那把看不见的剪刀还躺在H3的66GB权重里,没人翻出来过,排队的新弹幕每五分钟还在往里灌。