Dojo
话题
新佳
订阅
极道
元认知
元逻辑
元设计
元编程
元语言
DeepSeek时刻
DeepSeek核心贡献:将SFT和RL统一的数学公式
OpenAI首席研究官肯定了DeepSeek的核心成果:通过强化学习自动生成了思维链(这些归功于DeepSeek的统一数学公式),详细见:DeepSeek秘诀:能在学习过程中突然顿悟! 祝贺DeepSeek开发出o1级推理模型!他们的研究论文证明,他
DeepSeek+华为芯片将带火中国芯片行业
DeepSeek 可能会带火中国的芯片行业,让中国芯片进入一个超速发展时期: DeepSeek V3 从一开始就能在华为的 昇腾 Ascend 芯片上跑推理。华为的 910C 芯片(能匹配英伟达的 H100 )既可以用来训练,也能用来推理。 英伟达厉害的地方在于它的 CUDA(软件加生态系统),华为
6美元!DeepSeek极简法破解推理成本
上周五,一篇新李飞飞团队出品,简称s1论文">url=
在AMD芯片上运 DeepSeek R1精简推理模型
DeepSeek R1 Distilled Reasoning 模型通过“思路链推理”来仔细分析复杂的问题。它们不会马上给出答案,而是先花时间生成一系列的“思考”步骤,这通常需要内部处理几
AI自创符号语言:DeepSeek内部私语被曝光!
一个关于AI研究人员发现DeepSeek R1和V0之间对话的记录。文件中包含了一些抽象的符号和诗意的语言,可能是在描述某种新的交流形式或认知过程。 作者说:整个R1的后台会话是随机用一种符号语言进行的。如果没有C
“DeepSeek时刻”或致英伟达狂跌一年
1865年,威廉·杰文斯发现,尽管蒸汽机效率提升,英国的煤炭消耗却呈指数级增长。这一现象被称为“杰文斯悖论”:技术进步并未减少资源消耗,反而因应用范围扩大而增加了需求。类似的情况可能正在NVIDIA身上上演。尽管AI模型如DeepSeek-R1的效率不断提升,但这未必会减少对NVIDIA GPU的需
Deepseek两项关键发现:无需人类专家SFT、有自己专家语言DSL
Deepseek R1-Zero关键两项发现:无需人类专家、有自己专业领域语言DSL,也就是没有SFT,有自己DSL! ARC Prize基金会对DeepSeek发布的R1-Zero和R1“推理”系统的分析。 [b]ARC Prize基金是谁?[/b] ARC Prize基金
冲刺AGI对决:DeepSeek算法 vs 英伟达算力
人工智能发两个方向:GPU硬件和强化学习算法,这两个方向是条条大路通罗马还是南辕北辙? 首先,让我们了解一下强化学习算法代表DeepSeek DualPipe 算法,再谈谈英伟达的GPU硬件! [b]1、DeepSeek 的DualPipe 算法[/b] DeepSeek 的 DualPipe 算法
为何美国人认为deepseek是对openAI又一次扰乱?
中国Deepseek可能完全不是独立自主的技术,他们可能借鉴了openAI技术,这些都正常,在科技发展过程中,相互学习相互赶超,关键是其引起的蝴蝶效应会拖慢美国openAI研究。 萨姆·奥特曼(Sam Altman)这个人能力不值5000亿美元!他可能是我们美国输给中国的一个原因,因为他太自大了。
DeepSeek-R1涉及论文清单列表
DeepSeek-R1 是 AI 开放模型生态系统向前迈出的一大步,其最新模型在多项指标上与 OpenAI 的 o1 相媲美。他们用更少的资金和计算实现了这一目标,这一事实引起了很多炒作和关注。 如果想了解大模型的入门,参考这个比喻: [list] [*][url= [/list]
DeepSeek一文吓慌硅谷,英伟达市值蒸发6000亿!
上周五下午,杰弗里·伊曼纽尔在布鲁克林的家里开始写一篇博客。他坐在电脑前敲了好几个小时键盘,他老婆则忙着照顾小孩,顺便给他送点吃的。伊曼纽尔一直写到半夜,到周六凌晨,他已经写了差不
实时推理新王者:DeepSeek R1登录英伟达AI平台
DEEPSEEK-R1 API 即将作为可下载的 NIM 微服务提供,是 NVIDIA AI 企业软件平台的一部分. [url= [/url]是一个具有最先进推理能力的开放模型。Deep
扩展定律原作者说:DeepSeek v3低成本不稀奇!
Dario是2020 年原始扩展定律论文的作者,他谈了对当前 AI 模型扩展趋势的看法,特别是对 DeepSeek v3 和 Claude 3.5 Sonnet 的分析。 Dario 指出,AI 领域不断涌现出各种创新,这些创新可能是对模型架构的改进(比如对 [url= 架构[/url]的调整),也
Meta四个作战室正在研究DeepSeek
Meta 正在召集多个工程师的“作战室”,以研究 DeepSeek 的人工智能如何以极低的价格击败其他所有公司。 作战室: [list] [*]意味着的只是一群人需要在较长的一段时间
OpenAI发布新智能体:deep research
OpenAI又发布了一个名称类似deepseek的“深度研究”模型,它的表现比之前的模型强得多,甚至能完成一些连博士专家都需要花10小时才能搞定的任务。 周五,在“人类的最后考试”测试中最高分达到了 13% 的 o3-mi
新开源模型Tülu 3 405B可与Deepseek V3等顶级模型相媲美
艾伦人工智能研究所(Allen AI)最近发布了一个叫 Tülu 3 405B 的开源语言模型。这个模型很厉害,据说它的表现可以和[url= DeepSeek V3 [/url]以及 GPT-4o 相媲美,甚至可能比它们还要强。他们之所以能取得这样的成绩,主要归功于一种新的训练方法,叫做 RLVR(
Deepseek引发AI投资回报反思
如果训练人工智能的成本降低了,那么投资人工智能的回报就会更高。 对于那些在科技、工业、公用事业和能源领域已经因为“人工智能基础设施”而成功的公司来说,最大的风险是,一个简化版的 r1 模型可以在高端工作站(比如 Mac S
DeepSeek发布一款开源多模态人工智能模型Janus-Pro
DeepSeek刚发布了一款开源多模态人工智能模型Janus-Pro。其中Janus-Pro-7B在GenEval和DPG-Bench基准测试中击败了OpenAI的DALL-E 3和
上页
下页