Dojo
话题
新佳
订阅
极道
元认知
元逻辑
元设计
元编程
元语言
本地小语言模型
Qwen3.8-Max开源双炸:2.4万亿参数免费公开,27B模型专攻消费级显卡
2.4万亿参数模型直接开源权重,那些靠闭源卖API的厂商还睡得着觉吗? 通义千问团队扔出重磅炸弹,Qwen3.8-Max和Qwen3.8-27B即将同时开源,前者参数规模达到2.4万亿,后者专为消费级硬件优化。这次开源直接打破“最强模型只配闭源”的行业潜规则,让普通开发者在自家电脑上就能跑起接近顶级
Qwen3.8-27B在Mac上快3倍:mlx-dspark无损加速实测揭秘
Mac本地跑大模型快三倍,还一个字不差! 这可能是2026年Apple Silicon用户最该知道的秘密:Mac跑大模型,不用换硬件也能提速三倍! 一个GitHub项目,把Qwen3.8-27B的推理速度推到了新高度。8-bit目标模型,平均加速2.45倍,数学任务冲到3.00倍,代码任务2.38倍
Mac mini本地部署Hermes+Qwen3.8:慢30倍却省爆!
花799美元买一台Mac mini,让AI在你睡觉时干1小时42分钟的活——这买卖你干不干! 摘要: Qwen3.8-27B开源模型让本地AI代理成为现实。一位用户在24GB Mac mini M4上运行Hermes Agent,每晚花1小时42分钟生成AI新闻播报,全程本地推理、零API费用。本文
27B的Qwen3.8与3.6架构相同!性能怎么反超50%?
270亿参数的模型没改一根螺丝,性能怎么就翻天了! 把模型架构锁死,只靠训练数据硬扛——这事放在2026年的AI圈,听起来就像说F1赛车不换发动机只换汽油就能跑赢对手! 2026年8月14日晚,阿里巴巴千问团队正式开源Qwen3.8-27B。这是一款270亿参数的原生多模态稠密模型,原生支持262K
两块RTX 3090跑105 tok/s!Qwen3.8-27B本地部署实测
RTX 3090 是 2020 年的显卡,H100 是 2022 年的企业级产品,中间隔了整整一代半的硬件代差! 阿里巴巴千问团队正式开源 Qwen3.8-27B。这是一款 270 亿参数的原生多模态稠密模型,原生支持 262K tokens 上下文,通过 YaRN 技术可外推至 1M tokens
Redis之父把MiniMax H3塞进Mac,视频生成只需4步
你的Mac,可能正在浪费一个价值几十万的视频生成能力。 Redis之父antirez用一套代码证明:运行33B参数的视频生成大模型,不需要云端服务器,不需要A100显卡,你手边那台Mac就够了。 前不久,MiniMax正式发布新一代多模态生成模型MiniMax H3。这是一个330亿参数的全模态生成
MacStudio跑KimiK3:剪枝干掉73%专家 瘦身到350GB
PipeNetwork 的 kimi-k3-mlx 项目,是一个把 Moonshot AI 的超大规模模型 Kimi K3 转换到苹果芯片本地推理生态 MLX 的工程项目。它解决的核心问题是:让普通拥有大内存 Apple Silicon 机器的开发者,也能运行原本需要数据中心级 GPU 的 2.8T
Kimi K3本地使用版(1.56TB → 594GB),由Unsloth压缩并发布
Unsloth团队把1.56兆字节的模型压缩到594G字节,体积缩小将近三倍。 最小的那位版本只用了不到六成原版体积,却保留了七成九的准确率。 量化压缩把巨无霸模型塞进硬盘 人工智能模型由无数个参数组成,参数就像人脑里的神经元连接点。
阿里千问Qwen3.8-27B实测碾压Opus 5!一张3090就够了
# 22GB本地模型干翻Claude旗舰!你花200美元买的订阅,正在被一台旧电脑碾压! 你每个月付200美元给Anthropic,买的是“最强编码模型”的优先使用权。结果呢?一个开源的、22GB的、能在你自己电脑上跑的模型,在真实世界的代码任务里,把Claude Opus 5 High按在地上摩擦
Hermes借NeMo Relay升级:与DeepSeek V4 Flash 0731绝配
Hermes Agent 现在对弱鸡模型友好到离谱,本地跑 AI 再也不怕卡成 PPT 了。 2026 年 8 月 3 日,Hermes Agent 背后的大脑 Teknium 扔出一组数据,直接把 AI 代理优化这件事从“修修补补”拉到了“认知重构”的层面。借助英伟达 Nemo Relay 的观测
开源Qwen3.8 2.4T发布:本地跑不动,量化救不了贫穷
昨天,通义千问推出2.4万亿参数规模的开源模型Qwen3.8-2.4T,BF16格式权重高达4.9TB。 模型实测性能对标一线商业模型Fable,但开源版本刻意剥离视觉识别功能,上下文长度砍至250k。更大的模型不等于更好的体验,量化和参数规模的博弈正在把本地部署变成一场硬件的军备竞赛。 用数学
24GB显存Windows电脑上竟然跑起了DeepSeek-V4-Flash-0731?
Redditor网友惊呼:简直不敢相信我的家用电脑上居然运行着 DeepSeek-V4-Flash-0731,这可是早期版本啊!太不可思议了! 二十个月前,前沿AI模型还是云端专属,普通人只
7个自托管推理服务器终极对比:vLLM与SGLang谁领跑
自托管推理服务器,关键不在于吞吐量,也不在于你用什么显卡! 选推理服务器这件事,绝大多数人一上来就跑偏了! 当公司决定把开源模型搬回自己机房,理由很硬核:权重不要钱、数据不外流、财务再也不用对着API账单皱眉。但打开开源社区一看,能用的推理服务器少说十几个。每个都说自己快、每个都说自己省、每个都说自
买显卡跑模型必看:Shoehorn让14B模型塞进24GB显存
Shoehorn 是一个用 Rust 编写的开源工具,旨在解决大语言模型(LLM)量化中的一个核心痛点:如何让模型在量化后,恰好完美地填满你显卡的可用显存(VRAM),从而在有限的硬件资源下榨取最大的模型质量。 它通过一个“精确到字节”的混合精度量化方案,替代了传统固定量化级别(如 `
85万行代码审计实测:本地DeepSeek先输后平GPT-5.6
我让两个AI审计85万行代码,一个花了4美元找出32个漏洞,另一个零成本却编造了5个谎言! 花4美元和零成本的AI审计员,差距远不止价格那么简单! 周末我做了一个残酷实验:让两个顶尖AI模型分别审计一个85万行的真实商业代码库,结果一个在24分钟内找到了32个真实漏洞,另一个却编造了5个谎言——但故
开源运维工具OpsBrain:Qwen3驱动家庭自愈运维
OpsBrain 是一个为家庭实验室(Homelab) 设计的统一自动化运维工具,核心是构建一个“采集 → 推理 → 执行”的自动化闭环。它通过本地大语言模型(LLM)分析多节点状态,并执行安全的白名单操作。 核心工作流程 OpsBrain 以2分钟为一个周期(可配置)运行以下流程: 数据采集
Gemini 3.8 Live与Extended Thinking发布:Google把语音模型劈成两半
Google把语音AI劈成了两半,一半负责说话,一半负责思考! 你以为语音助手变聪明了,其实它只是学会了边想边说! 2026年9月15日,G
jev打平GPT-5.6-terra分类性能:专用模型逆袭通用大模型
2026年9月一个叫jev的分类API突然炸场,号称用零头成本就能打平OpenAI最强的GPT-5.6-terra! 你花一块钱能办的事,为什么非要花一百块让大模型来干? jev是一个只做文本分类的轻量接口,GPT-5.6-terra是OpenAI的通用大模型,两者在分类任务上性能几乎持平,但调用成
下页