• 我对在本地运行大型语言模型 (LLM) 的可能性感到兴奋。我决定为此买一张显卡,并想分享我使用 NVIDIA RTX 5060 Ti 16GB 的初步体验。简单来说,这是我的第一张专用显卡。我之前没
  • 在各种硬件(3090、4090,以及几台 Mac)上进行了各种速度测试和基准测试,速度比较:4090 VLLM、3090 LCPP、M3Max MLX、M3Max LCPP 与 Qwen-30B-
  • 使用 8xRTX 4090 构建 GPU 服务器实现大模型本地部署和运行推理:Marco Mascorro 构建了一个非常酷的 8x4090 服务器用于本地推理,并编写了一个非常详细的操作指南 icon
  • DeepSeek R2 的病毒式小道消息:DeepSeek R2:单位成本下降97.3%,即将发布。 其自研分布式训练框架实现昇腾910B芯片集群利用率达82%,在FP16精度下实测算力达512PetaFLOPS,达到同规模A100集群的91%效能(华为实验室验证数据)。 特点: [list] icon
  • 本文来自一美国博文:我们需要一个美国版的深度求索(DeepSeek)。 我们需要一个自主、开源的通用人工智能(AGI)巨头,而且现在就要。 因为美国的前沿实验室正在输掉这场竞赛。 不信? 每出现一个美国的闭源或专有模型,我们就能看到中国涌现出数十个工业级开源模型。 美国唯一的开源标杆——Meta,在 icon
  • 在 Google Cloud Next 25 大会上,谷歌隆重推出第七代张量处理单元 (TPU) Ironwood。它是可扩展性最强的定制 AI 加速器,也是首款专为推理而设计的加速器。 谷歌TPUv7: [list] [*]每秒能算4.6千 icon
  • 前几天我试用了新出的Qwen3-30B大模型,在Ollama上跑得跟蜗牛爬似的!气得我直接换了LM Studio这个软件,结果我的RTX4090显卡直接起飞了,每秒能处理100多个词,快得跟开了挂一样! 经过一顿猛如虎的测试后,我激动得差点从椅子上摔下来——这简直就是我的梦中情模!不管是翻译外语、写 icon
  • Bolt Graphics的Zeus系列GPU采用RISC-V架构,集成大容量内存和高速网络(400G/800GbE),适合集群计算。目标低功耗、高扩展性,2025年推 icon
  • “小芯片chiplet”和“混合组装”这两个词现在满天飞,新闻里、论文里、产品发布会上到处都是。虽然工程师们基本能看懂这些内容,但做报告的人讲到一半也常会[url= 比如纠结某个芯片到底算不算“小芯片chiplet”,或者发现大家对“混合组装”的理解五花八门。问题就在于,这两个词到现在都没有统一的定 icon
  • Llama 4 + Apple Silicon 简直是天生一对。 原因在这儿:就像 DeepSeek V3/R1 一样,新的 Llama 4 各种版本都是超大的稀疏 MoE 模型 icon
  • 我们搞了个AI模型"闪电启动器",让大模型像Windows休眠功能一样秒开秒关! 以前跑AI大模型特别麻烦——每次用都要重新加载,像开电脑等系统启动一样慢,而且显卡内存根本塞不下几个模型。现在我们搞出了新方法,2-5秒就能唤醒一个AI(130亿到650亿参数都行),还能让一块显卡轮流跑50多个模型, icon
  • 当我提到“大型语言模型”时,你首先想到的是什么?可能是像 ChatGPT、Gemini、Claude 或 Meta 的 LLaMA 这样的模型——对吧?如果我问你这些模型的驱动力是什么?答案几乎总是相同的——GPU 。昂贵、耗电的 GPU,通常都来 icon
  • 因为用的人太多,OpenAI 现在暂时不让新用户玩 Sora 视频生成功能了。这事儿发生的时候,他们正忙着应付大家疯抢新出的 GPT-4o 图片功能——之前有个叫 [b]Ghibli 的功能太火爆[/b],直接把他们的显卡算力给榨干了。不过新用户还是能正常玩图片生成,只是视频功能被限了。 OpenA icon
  • Llama 4 Maverick在单个RTX 4090上以45 tk/s的速度本地化-我终于让它工作了! 我刚刚完成了一个后续的演示,我从Meta的4000亿参数,128个专家Llama 4 icon
  • 英伟达终于给自家的CUDA工具包装上了原生的Python支持。要是你对编程、人工智能感兴趣,或者单纯爱看黑科技突破,这回可算来着了!Python这几年火得不行,GitHub 2024年调查显示它已经干掉了JavaScript,成了全球最受欢迎的编程语言。 所以英伟达这波操作可不是拍脑袋决定的,而是要 icon
  • 微软研究人员表示,他们已经开发出一种可在 CPU 上运行的超高效 AI 模型 微软的研究人员说,他们造出了目前为止最大的“1比特”人工智能模 icon
  • DeepSeek 的通用奖励模型(GRM)通过推理时缩放优化奖励信号,让本地大模型更高效: [list=1] [*]减少训练成本——动态调整计算量,避免冗余训练; [*]提升泛化能力——适应多任务,无需反复微调; [*]开源可商用——本地部署更灵活,降低依赖云端成本。 [/list] 阅读原文点击标 icon
  • 就在白宫一边到处打贸易战一边忙着安抚全球市场的时候,特朗普政府突然宣布:手机、电脑这些电子产品不用交巨额"对等关税"了!这下可把苹果这些科技巨头乐坏了。 海关周五半夜发的通知说,智能手机、路由器、芯片机、无线耳机还有部分电脑,都不用交特朗普对中国货加征的125%惩罚性关税了。这对苹果、英伟达、微软简 icon