Mac mini本地部署Hermes+Qwen3.8:慢30倍却省爆!


花799美元买一台Mac mini,让AI在你睡觉时干1小时42分钟的活——这买卖你干不干!

摘要: Qwen3.8-27B开源模型让本地AI代理成为现实。一位用户在24GB Mac mini M4上运行Hermes Agent,每晚花1小时42分钟生成AI新闻播报,全程本地推理、零API费用。本文对比Mac mini与RTX 5090的真实性能数据,拆解本地AI代理的隐藏成本与真实收益,告诉你“免费”的本地推理到底藏着多少坑。

一台24GB的Mac mini,真的能让AI替你打工吗

2026年8月14日,Qwen3.8-27B的权重在Hugging Face上正式开源。这不是什么云端API的更新公告,而是一个27B Dense多模态模型的完整权重包,55.6GB,Apache 2.0协议,随便下载、随便改、随便商用。

紧接着,Unsloth放出了本地部署方案。根据文档,Qwen3.8-27B的4-bit量化版本只需要17到19GB总内存就能启动。RTX 4090能跑,RTX 5080能跑,24GB统一内存的Mac也能跑。

这意味着一件事:一个在SWE-bench Pro上拿到61.7分、在LiveCodeBench v6上拿到90.3分的模型,现在可以跑在你桌面上那台799美元的Mac mini里。它的Agent能力在DeepSWE基准上从13.3暴涨到42.2。换句话说,一个本地27B模型在某些Agent任务上已经超过了Opus4.6 Max。

但问题来了。跑起来是一回事,跑得动是另一回事。一个叫@spydenator的用户在X上分享了他的实验:在Mac mini M4 24GB上运行Hermes Agent,让它收集过去24小时的AI新闻,用Lumon Industries的微数据提炼格式生成播报,再语音朗读出来。整个过程耗时1小时42分钟。

1小时42分钟。生成速度约16.8 tokens/sec,prompt-eval速度约40.6 tokens/sec。

这个数字放在RTX 5090面前简直是笑话——后者跑Qwen3.8-27B在编码场景下能达到150 tok/s,纯聊天能冲到300 tok/s。但这位用户说了一句话,让整个事情的性质变了:“它晚上在我睡觉的时候运行,M4通常处于闲置状态,早上我醒来的时候它就已经在运行了。所有操作都在本地完成,除了Mini的电费之外没有任何其他成本。”

等等。一台24小时开着的Mac mini,在你睡觉时干了1小时42分钟的活,没有API账单,没有按token计费,没有数据上传到云端——这真的只是“慢”而已吗!

Hermes Agent到底是什么,为什么它让本地AI代理变成了现实

要理解上面那个1小时42分钟的实验到底意味着什么,得先搞清楚Hermes Agent是什么。

Hermes Agent是Nous Research在2026年2月发布的开源自主AI智能体。它不是那种绑在IDE里的代码补全插件,而是一个跑在终端里的自进化AI代理。它可以从经验中创建技能、在使用中改进技能、主动持久化知识、搜索过往对话,跨会话逐步构建对你的深度理解。

更重要的是,Hermes Agent跟任何LLM提供商都能配合——OpenRouter、Anthropic、OpenAI、DeepSeek、本地模型,十五种以上。Linux能跑,macOS能跑,WSL也能跑。它可以在本地Docker里跑,也可以在SSH远程跑,甚至可以在五美元的VPS上跑。

这意味着什么?意味着你可以把Hermes Agent当成一个24小时待命的数字员工。给它一个任务——“收集过去24小时的AI新闻,按某种格式整理好,读给我听”——它就去干了。不需要你盯着,不需要你反复调prompt,不需要你为每次API调用付钱。

但有一个前提:你得给它一个“大脑”。这个大脑就是Qwen3.8-27B这样的本地模型。

所以@spydenator的实验其实是在测试一条完整的本地AI代理流水线:硬件是Mac mini M4 24GB,大脑是Qwen3.8-27B,躯干是Hermes Agent,任务是从互联网抓取AI新闻、整理成结构化播报、再用语音读出来。所有环节都在本地完成,没有任何数据离开他那台Mini。

1小时42分钟。这个数字放在这里,既是一个性能指标,也是一个成本宣言。

799美元的Mac mini对上一张显卡的钱——性能差多少,成本差多少

先看数字。

Mac Mini M4 24GB跑Llama 3.2 8B大约是30 tokens/sec。跑Qwen 14B Q4大约20 tok/s。如果换成M4 Pro 48GB,跑32B模型能到10到15 tok/s,整机功耗只有20到40瓦。

RTX 5090呢?单卡32GB VRAM,真实工作负载平均约650 tok/s。跑Qwen3.8-27B在编码场景下150 tok/s,纯聊天冲到300 tok/s。如果用专门优化的推理引擎,prefill阶段能到5,300 tok/s。

速度差距是10倍到30倍。这个差距大不大?大到离谱。

但问题不在于速度本身,而在于速度的价值怎么算。

一台RTX 5090的售价在2000美元以上。一台Mac mini M4 24GB是799美元。前者需要额外的电源、散热、机箱,后者插上电就能用,整机功耗不到40瓦。

更重要的是使用场景。@spydenator把任务放在晚上跑。Mac mini本来就24小时开着——它还要跑监控代理、跑其他后台任务。在它闲置的时间里跑一个1小时42分钟的AI任务,边际成本几乎为零。电费?Mac mini M4满载功耗40瓦,1小时42分钟耗电0.068度,按美国平均电价算不到一美分。

RTX 5090满载575瓦。跑同样的任务1小时42分钟,耗电0.98度,电费约12美分。也不贵。但显卡本身的价格差距足够买两台半Mac mini。

所以问题变成了:你要为那30倍的速度提升多付1200美元,值不值!

1小时42分钟到底算不算慢——得看你拿它跟什么比

“1小时42分钟生成一份AI新闻播报”——这个描述本身就带着误导性。

让我们拆开看这1小时42分钟里到底发生了什么。@spydenator的任务是:“收集过去24小时的AI新闻,并以Lumon Industries的微数据提炼格式,结合Deconstruct Lab的风格,用语音朗读给我听。”

这不是一个简单的“生成文本”任务。它包含至少四个环节:第一,从互联网抓取过去24小时的AI相关新闻;第二,把抓取到的原始信息按“微数据提炼”的格式重新组织;第三,用特定风格(Deconstruct Lab)润色成播报稿;第四,把文本转成语音朗读出来。

每一步都在本地完成。没有云端API加速,没有预缓存的新闻源,没有现成的播报模板。

如果换成云端方案呢?用Claude API或GPT-4 API跑同样的工作流,单次复杂任务可能消耗50K到100K tokens。按主流API的定价,单次花费大约1元人民币。如果每天跑一次,一个月30元,一年360元。

看起来不贵。但别忘了这是“单次任务”的价格。如果让这个代理进入自动化脚本的高频运行阶段——比如每小时检查一次新闻源、每有新内容就生成一次播报——API账单会迅速膨胀。

更重要的是数据隐私。所有新闻内容、所有处理过程、所有中间结果都在本地流转。没有任何数据包离开你的网络。这对于处理敏感信息或者单纯不想让云端模型“学习”你的使用习惯的人来说,是硬性需求。

所以1小时42分钟不是“慢”,是“在特定约束下的最优解”。这个约束叫“不出本地、不花API钱、不担心隐私泄露”。

但等一下——你真的“免费”了吗

“除了Mini的电费之外没有任何其他成本。”

这句话听起来无懈可击。但让我们用分析哲学的放大镜看看“成本”这个词到底指涉了什么。

显性成本确实只有电费。799美元买Mac mini是一次性投入。模型权重免费下载。Hermes Agent开源免费。电费几乎可以忽略。

但隐性成本呢?

第一个隐性成本是时间。不是机器的运行时间——那是晚上睡觉时跑的,不影响你。是你的调试时间。让Hermes Agent理解“Lumon Industries的微数据提炼格式”需要多少轮调试?让语音合成的音色和节奏符合“Deconstruct Lab的风格”需要多少次迭代?这些你醒着的时间才是真正的成本。

第二个隐性成本是硬件折旧。799美元的Mac mini用三年,每年折旧约266美元。如果它每天只跑1小时42分钟的AI任务,其余时间闲置或跑轻量级监控,那这笔折旧费分摊到每次任务上并不低。

第三个隐性成本是机会成本。同样的799美元如果用来买云端API额度,按中等使用量每月25到50美元算,能用16到32个月。而且云端模型是持续更新的——你今天用Claude 4.0,明天可能就是4.5。本地模型呢?Qwen3.8-27B的权重文件55.6GB。下次升级又要重新下载、重新配置、重新调试。

但话又说回来。对于“每天都要跑、数据不能出本地、用量稳定可预测”的工作流,本地方案确实有它的不可替代性。

Qwen3.8-27B到底有多能打——别被厂商的benchmark骗了

说到Qwen3.8-27B,官方数据确实漂亮。SWE-bench Pro 61.7,超过Opus4.6 Max的53.4。DeepSWE从13.3暴涨到42.2。LiveCodeBench v6做到90.3。Terminal Bench 2.1从63.4涨到73.0。

但有一行小字值得注意:“每个benchmark仍然是阿里自己报告的。”独立第三方的验证还没有出来。

还有另一个细节:官方宣称的1M上下文是托管版本才有的功能,本地部署只能用原生的262K。差了将近四倍。

再看性能代价。独立测试发现,Qwen3.8-27B比前代慢了大约三倍,而且更耗token。换句话说,同样一个任务,新模型要用更多时间去思考、用更多token去表达。对于本地部署来说,这意味着更长的等待时间和更高的内存占用。

但即便如此,能在24GB统一内存的Mac上跑起来的27B模型,在2026年8月这个时间点,确实没有对手。

“Lumon Industries的微数据提炼格式”——一个让人后背发凉的比喻

@spydenator在prompt里写了一句很有意思的话:“以Lumon Industries的微数据提炼格式”整理AI新闻。

Lumon Industries是美剧《Severance》(人生切割术)里的那家虚构公司。剧中的宏观数据精简部(Macrodata Refinement)员工每天对着屏幕上的数字进行分类,凭“感觉”把数字归入不同的桶里,但完全不理解自己处理的数据到底意味着什么。

这个比喻用在这里太妙了。你在本地跑一个AI代理,让它收集新闻、整理格式、生成播报——你给它指令,它执行任务,你看到最终输出。但中间的过程呢?Hermes Agent到底是怎么“理解”你的指令的?Qwen3.8-27B的262K上下文里到底发生了什么?那些被“提炼”的新闻数据在模型的权重空间里经历了怎样的变换?

你不知道。也不需要知道。你只是那个坐在终端前、看着进度条缓慢推进的“精炼师”。

更讽刺的是,剧中Lumon的员工把数字分类到“WO”“FC”“DR”“MA”四个桶里——分别对应Woe、Frolic、Dread、Malice四种情绪。而你在做的事情,是让一个神经网络把新闻文本分类、提炼、重新组织。本质上都是在做“数据精炼”,只不过你的工具是transformer,他们的工具是……呃,自己的脑子?

这个比喻把本地AI代理的“黑箱”性质暴露得一干二净。你不知道模型怎么处理你的数据,就像MDR的员工不知道那些数字代表什么。你唯一能确认的是:输入进去了,输出出来了,中间发生了什么?别问。

所以那个1小时42分钟的夜晚,到底发生了什么

让我们回到那个晚上。

Mac mini M4 24GB在凌晨时分开始执行任务。Hermes Agent启动,调用本地的Qwen3.8-27B模型。模型开始处理prompt:“收集过去24小时的AI新闻,并以Lumon Industries的微数据提炼格式,结合Deconstruct Lab的风格,用语音朗读给我听。”

第一步是理解指令。262K的上下文窗口足够容纳大量新闻源数据。但模型需要先“想清楚”去哪找新闻、怎么判断哪些是AI相关、怎么区分过去24小时的时间边界。

第二步是执行抓取。Hermes Agent通过内置的工具调用能力访问网络。这一步最耗时——网络请求的延迟、页面加载的速度、内容提取的效率,全都卡在本地网络的带宽和延迟上。

第三步是数据处理。把抓取到的原始文本按“微数据提炼”的格式重新组织。这里涉及到分类、摘要、重新排版。Qwen3.8-27B在Agent任务上的提升主要体现在这个环节。

第四步是风格转换。用Deconstruct Lab的风格润色成播报稿。这一步需要模型理解什么是“Deconstruct Lab的风格”——可能是简洁、可能是技术性、可能是带点幽默。模型需要从有限的上下文里推断出这个风格偏好。

第五步是语音合成。把文本转成语音并朗读出来。这一步在Mac mini上可能用到Apple的Neural Engine,38 TOPS的算力足够应付语音合成。

整个链条走完,1小时42分钟。

prompt-eval速度40.6 tokens/sec,生成速度16.8 tokens/sec。这意味着模型在“理解指令”阶段(prompt-eval)比“生成内容”阶段(生成)快了2.4倍。很合理——理解比表达快,就像你读题比写答案快一样。

但1小时42分钟里到底有多少是模型推理、多少是网络请求、多少是语音合成?@spydenator没公布细项数据。这个缺口让整个实验的可复现性打了折扣。

下一场实验:把任务扔给RTX 5090会怎样

@spydenator在帖子的最后说了一句话:“下一个实验,把这个任务迷你版发送到我的RTX-5090机器上,看看它能不能飞起来。”

“飞起来”是什么意思?如果Mac mini跑1小时42分钟的任务,RTX 5090按150 tok/s的编码速度算,理论上只需要大约11分钟。如果纯聊天模式300 tok/s,只需要5分半。

但这里有个坑。“迷你版”这个描述很关键。为什么是迷你版?因为RTX 5090虽然快,但32GB VRAM能塞下的模型版本和Mac mini 24GB统一内存能塞下的版本可能不一样。量化方式不同、上下文长度不同、batch size不同,都会影响最终结果。

更重要的是,RTX 5090跑同样的工作流,耗电575瓦。Mac mini只耗40瓦。速度提升30倍,功耗提升14倍。每瓦算力的提升其实没那么夸张。

还有一个变量:RTX 5090的推理框架。用vLLM还是llama.cpp?用FP8还是INT4?KV cache用FP8还是不用?这些选择对速度的影响可能比硬件本身还大。

@spydenator的实验还没做。但结果会很有意思——如果RTX 5090跑完全程只需要10分钟,那“速度”和“成本”的账就要重新算了。但如果中间出了什么岔子——OOM、驱动崩溃、框架不兼容——那1小时42分钟的“慢”反而显得更可靠。

你回不去了——因为一旦开始算这笔账,就再也停不下来

回到开头那个问题:花799美元买台Mac mini,让AI在你睡觉时干1小时42分钟的活,这买卖你干不干?

答案取决于你怎么定义“划算”。

如果你看重的是每美元能买到的算力,Mac mini M4 24GB跑Qwen3.8-27B的速度是16.8 tok/s。799美元,每美元买到0.021 tok/s。RTX 5090跑同样的模型是150 tok/s。2000美元,每美元买到0.075 tok/s。RTX 5090的性价比是Mac mini的3.6倍。

但如果你看重的是“不用交API账单”和“数据不出本地”,Mac mini的方案无可替代。每天跑一次,一年省下360元API费用。再加上电费差异和隐私保护的价值,这台Mac mini在一年半左右就能回本。

但如果你看重的是“我醒着的时候就要结果”,那1小时42分钟绝对无法接受。你得加钱上RTX 5090,或者干脆用云端API——反正你醒着的时候,时间比钱贵。

这个选择没有标准答案。因为“划算”这个词在不同的约束条件下指向完全不同的方向。

唯一确定的是:一旦你开始计算本地AI代理的真实成本——硬件折旧、调试时间、推理速度、API替代价值、隐私保护溢价——你就再也回不到“云端API最方便”的那个天真状态了。你知道得太多了。

那台Mac mini在夜里跑了1小时42分钟。它处理的数据没有离开过你的网络。它生成的播报只有你能听到。它花掉的电费不到一美分。但它慢得让你怀疑人生。

所以问题最终变成了:你要的是速度,还是主权?