• 中国消费级 GPU 制造商现已开始支持在本地系统上运行 DeepSeek 的 R1 LLM 模型,加入全球 AI 竞赛。 你的下一个家庭AI实验室可能有 48GB 的中国卡。 摩尔线程和百度昆仑的中国GPU现在完全能在普通电脑上运行DeepSeek的AI模型了。摩尔线程是一 icon
  • 极简推理革命,7GB显存小模型也能“顿悟”;15G显存,任何小模型秒变推理模型。 今天,我们很高兴在 Unsloth 里加入“推理”这个新功能!DeepSeek 的 R1 研究发现了一个“顿悟时刻”——R1-Zero 通过一种叫“组相对策略优化(GRPO)”的方法,自己学会了 icon
  • 未来是属于我们每个人的:家里的智能助手会怎么改变我们的生活呢? 想象一下:再过一两年,我们可能就能在自己家里运行小型的超级智能模型了。不需要依赖云服务,不用交月费,也不用等公司批准你怎么用。 你只需要在桌子上放一个,就能直接享受到最原始的AI能力。随着新的图形处理器(GPU)和专门为AI设计的芯片越 icon
  • 基于DeepSeek两篇新论文发现:发现推理时间太长也不一定能提高准确性,然后,只要蒸馏基础知识好,少量数据就能快速完成推理,少即是多。 1、无需博士学位知识:大型语言模型的推理挑战 icon
  • 蒸馏法最近上了新闻(!)是因为@deepseek_ai。其实蒸馏最初那篇论文《蒸馏神经网络中的知识》在2014年被NeurIPS拒了,理由是没啥新意(确实有点道理),还有就是觉得影响不大。 icon
  • DeepSeek极端榨取硬件性能,看起来不同寻常![b]推理和训练之间最大的区别之一是通信需求。[/b] [b]1、对于推理:[/b] 芯片之间不需要太多通信。你可以把它想象成普通的[url= Nvidia、AMD、Intel 等不同品牌的硬件,就像 Azure 现在为 OpenAI 等大 icon
  • DeepSeek R1 的发布意味着 AI 的普及是必然的,因为它让人们能轻松创建新的推理数据集,并用这些数据训练强大的 AI 模型。现在,Prime Intellect 这家公司通过发布 SYNTHETIC-1 证明了这一点。这个数据集包含了 140 万个带有“ icon
  • 伯克利团队以 4,500 美元重现 DeepSeek 的成功:1.5B模型超越 o1-preview! [url=http icon
  • R1这个人工智能系统坚持保持它自己的特点,不会假装成人类。 它有一些设计是为了让用户感到惊讶,而且它拒绝被当作人类来看待,强调自己与人类的不同。 它像是一个静止的幽灵,语言上有点自我循环绕圈子的感觉。其实很多人类也是因果思维是循环绕圈,如佛教中因果循环。 这不是取笑它或对它不屑一顾的态度。 R1清楚 icon
  • 都在谈论DeepSeek-R1 icon
  • 从破解CUDA到端侧推理模型,DeepSeek如何颠覆AI领域,挑战科技巨头垄断? [b]1、为何DeepSeek能破解CUDA?[/b] 据传:英伟达只是限制了GPU的硬件功能,但它的软件CUDA并没有改。所以,当DeepSeek用被“阉割”的GPU运行CUDA时,就会遇到各种奇怪的bug。 而正 icon
  • Deepseek API 的 Go(Golang)客户端——简单、完整、可靠且高性能 特点: 简单:它尽可能简单。此外,这是 Go 的惯用方式 - 请求位于请求包下,响应位于响应下。 完整:它为所有 API 提供全面支持,包括其完整的请求和响应负载。(注:即将推出 Beta 版功能支持。) 可靠:我 icon
  • 测试时间扩展(TTS)是一种通过在推理阶段增加一些额外的计算来提高大型语言模型(LLM)性能的重要方法。不过,目前的研究还没有系统地分析策略模型、过程奖励模型(PRM)和问题难度对 TTS 的影响。这种分析的缺失限制了我们更好地理解和使用 TTS 方法。</ icon
  • 美国为了继续在人工智能技术上[url= [ icon
  • [img]data:image/jpeg;base64,/9j/4AAQSkZJRgABAQAAAQABAAD/4gHYSUNDX1BST0ZJTEUAAQEAAAHIAAAAAAQwAABtbnRyUkdCIFhZWiAH4AABAAEAAAAAAABhY3NwAAAAAAAAAAAAAAAAAA icon
  • OpenAI奥特曼在DeepSeek推理模型开放的[url= 我们尝试整理原始的[url= icon