• DeepSeek R2 的病毒式小道消息:DeepSeek R2:单位成本下降97.3%,即将发布。 其自研分布式训练框架实现昇腾910B芯片集群利用率达82%,在FP16精度下实测算力达512PetaFLOPS,达到同规模A100集群的91%效能(华为实验室验证数据)。 特点: [list]
  • BitNet b1.58 2B4T是微软研究院开发的第一个开源、纯1比特大语言模型(LLM),规模达到20亿参数。 它用4万亿个token训练而成,证明了纯1比特的大语言模型性能可以媲美同尺寸的主流开源全精度模型,同时在计算效率(内存占用、能耗、响应速度)上具有巨大优势。 [url=
  • icon
  • Unsloth Dynamic v2.0 是一种超强AI模型压缩技术,专门用来让大语言模型(比如ChatGPT这类AI)变得更小、更快,但几乎不掉智商! [list=1] [*]减肥神器:原本几十GB的大模型,经过它压缩后可能只剩几GB,但性能几乎不降! [*]加速神器:压缩后的模型跑得更快,普通电 icon
  • Google新出的Gemma 3 QAT模型能让普通显卡用户也能用上顶级AI。这个经过特殊优化(QAT)的int4版本Gemma 3,把显存需求从54G icon
  • 分析:深度求索(DeepSeek) vs Llama3 vs 英伟达超算(Nemotron) vs Llama4独行侠(Maverick) 这篇测评对比了四个大语言模型在逻辑推理、功能应用、性能表现和安全防护方面的表现。参评模型包括: 深度求索-V3-0324版 采用"专家混合"架构(MoE),总参 icon
  • 全新开源型号 GLM-4-32B,性能媲美 Qwen 2.5 72B 该模型来自 ChatGLM(现为 Z.ai)。此外,还提供推理版、深度研究版和 9B 版(共 6 个模型)。MIT 许可证。 Z.ai 是由智谱AI(北京智谱华章科技有限公司,Zhipu AI)运营的一个平台。智谱AI是一家成立于 icon
  • MAI-DS-R1 是一个 DeepSeek-R1 推理模型,经过微软 AI 团队的后期训练,旨在填补先前版本模型中的信息空白,并提升其风险状况,同时保持 R1 推理能力。该模型使用来自Tulu 3 SFT 数据集的 11 万个安全和不合规示例进行训练,此外还使用了内部开发的约 35 万个多语言示例 icon
  • OpenAI给AI加上了"记忆功能",这可能是GPT-3问世以来最重大的升级。 简单来说就是: 以前的人工智能就像个特别聪明但记性差的朋友。就像那种知识渊博的教授,能回答各种难题,但连你的生日都记不住。 现在有了记忆功能,AI终于能记住关于你的一切了。这意味着: 不用每次都重复交代< icon
  • 我们搞了个AI模型"闪电启动器",让大模型像Windows休眠功能一样秒开秒关! 以前跑AI大模型特别麻烦——每次用都要重新加载,像开电脑等系统启动一样慢,而且显卡内存根本塞不下几个模型。现在我们搞出了新方法,2-5秒就能唤醒一个AI(130亿到650亿参数都行),还能让一块显卡轮流跑50多个模型, icon
  • 当我提到“大型语言模型”时,你首先想到的是什么?可能是像 ChatGPT、Gemini、Claude 或 Meta 的 LLaMA 这样的模型——对吧?如果我问你这些模型的驱动力是什么?答案几乎总是相同的——GPU 。昂贵、耗电的 GPU,通常都来 icon
  • 最近那些超级AI(比如DeepSeek之类推理模型)变得特别会做题,秘诀就是让它们像人类一样"把思考过程写出来"。但这篇论文发现了个反常识的现象——有时候不思考反而更厉害! [b]神奇发现:[/b] 用最新AI"深度求索-R1-蒸馏版"做实验,发现只要对它说"别想了直接答",成绩反而更好!尤其在以下 icon
  • 这是来自Deepseek和阿里千问Qwen混合模型的编码模型。媲美OpenAI o1、 o3-mini级别的编码推理模型,而且完全开源!数据集、代码和训练配方全部开放。 DeepCoder是一个用"团队训练法"(分布式RL)培养出来的AI编程助手。就像让多个老师同时辅导一个学霸(Deepseek-R icon
  • Llama 4 Maverick 与 Deepseek v3 0324 对比 Llama4 Maverick 和 Llama 4 Scout 是 Meta Llama 系列的最新成员。Maverick 是一个 400B 稀疏模型,拥有 17b 个活动参数和 128 位专家;Scout 是一个 109 icon
  • 《纽约时报》周三爆料:特朗普团队正琢磨着对中国AI公司DeepSeek下狠手,不仅要断供英伟达的AI芯片,还可能直接不让美国人用他家的人工智能服务。 这招明显是要在AI赛道卡中国脖子。自从DeepSeek的AI技术惊艳硅谷和华尔街,美国官员就绞尽脑汁要切断中国获取美国技术和用户的渠道。 就在周二,白 icon
  • Llama 4 Maverick在单个RTX 4090上以45 tk/s的速度本地化-我终于让它工作了! 我刚刚完成了一个后续的演示,我从Meta的4000亿参数,128个专家Llama 4 icon
  • 一些内部人士表示,Meta 的人工智能研究实验室正在“缓慢消亡”。Meta 更愿意称之为“一个新的开始”。 上周,当Meta公司的人工智能研究负责人乔尔·皮诺宣布辞职时, icon
  • DeepSeek 即将开源其推理引擎,该引擎是基于 vLLM 的修改版本。现在,DeepSeek 正准备将这些修改回馈社区。 几周前,在"开源周"活动里,我们公开了几个代码库。没想到大家特别热情—— icon