Dojo
话题
新佳
订阅
极道
元认知
元逻辑
元设计
元编程
元语言
DeepSeek时刻
DeepSeek工程师刚开源nano-vllm:演示AI核心
DeepSeek员工刚刚开源了nano-vllm ,点击标题。 它是一个从头开始构建的轻量级vLLM实现。 关键特征 [list] [*]快速离线推理-与vLLM的推理速度相当 [*]易读的代码库-在约1,200行Python代码中实现干净 [*]优化套件-前缀缓存,张量优化,火炬编译,C
强化学习:AI推理游戏的颠覆性突破引擎
强化学习正在改变一切,从人工智能的思维方式到科技巨头数十亿美元的基础设施:AI基础设施瓶颈与变革、蒸馏、数据是护城河、递归式自我提升、o4 和 o5 强化学习训练! Semianalysis写了一篇很长的文章,解释了为什么模型可以突然连贯地工作很长时间,这对未来意味着什么,以及它是如何工作的。以下是
本地运行DeepSeek-R1-0528指南
现在可以在本地设备上运行 DeepSeek-R1-0528!(至少 20GB RAM) 大家好!2天前,DeepSeek对他们的R1模型进行了巨大的更新,使其性能与OpenAI的o3,o 4-mini-high和Google的Gemini 2.5 Pro相当。 早在一月份,你可能还记得我的帖子,关于
Osmosis-Apply-1.7B:Qwen+Cursor开源编程工具
使用RL可以很容易地微调小型模型,使其在垂直任务上优于基础模型。我们正在开源Osmosis-Apply-1.7B:一个比基础模型更好地合并代码的小模型(类似于Cursor的即时应用)。 Osmosis-Apply-1.7B就像个"代码拼图高手",它是在阿里千问[b]Qwen3-1.7B[/b
企业定制AI:18步搞定本地模型微调实战
手把手教你玩转AI模型微调!零基础也能秒懂 [b]什么是微调?(给模型开小灶)[/b] 想象GPT-4是个全能学霸,但OpenAI给它开了"家教课"专门练对话,这才有了我们现在用的ChatGPT!就像: [list] [*]你给原版模型(比如Llama-3)喂专属资料补课 [
这个AI提示将改变你的生活
这个AI提示将改变你的生活,直接复制到DeepSeek/ChatGPT聊天框中: [code]我想做个实验。你可以问我任何你想问的问题。我会尽可能真实完整地回答。根据我的回答,你可以再问我一个问题。我们会反复进行,直到问题解决。我想揭示我内心深处的一些想法。谬误、局限性、潜力、需要改进的地方,任何目
华为盘古 Pro MoE:专为昇腾芯片优化的AI模型
盘古Pro MoE是专门为昇腾300I双胞胎和800I A2特调优化! 盘古Pro MoE是华为于2025年5月28日发布的大语言模型,其基于创新的分组混合专家模型(Mixture of Grouped Experts, MoGE) 架构,在专家选择阶段对专家进行分组,并约束
快速免费搭建一套完整自托管的AI编程助手
简而言之:VSCode + RooCode + LM Studio + Devstral + Ollama + snowflake-arctic-embed2 + docs-mcp-server。一个快速、免费、自托
德国或下架Deepseek!涉隐私偏见引争议
柏林数据保护专员向苹果和谷歌报告了人工智能应用Deepseek的非法内容,原因是在没有充分保障的情况下将个人数据传输到中国。 柏林数据保护和信息自由专员根据《数字服务法》(DSA)第16条将Deepseek标记为非法内容。苹果和谷歌现在必须审查这份报告,并决定是否在德国屏蔽这款应用。 Deepsee
年中总结:OpenAI领跑 谷歌逆袭 DeepSeek加劲
【年中AI期末考试红黑榜】用最炸裂的方式给你讲清楚各大科技公司的AI战况! OpenAI:学霸中的战斗机! [list] [*]手握GPT-4o三件套(标准版/Pro版),年底还要放大招GPT-5 [*]周周有更新,月月发新工具,用户数像坐火箭 [*]目前AI界扛把子,稳得就
DeepSeek新版R1口味从Chatgpt换成Gemini
给AI模型做"DNA亲子鉴定"!文本风格分析显示,新版R1现在更接近Google。 所以他们可能使用了更多的合成双子输出进行训练。 想象每个AI模型都会在作文里留下自己的"口水印"——老版的r1家族用的是OpenAI牌的"口水",新版的r1家族改用Gemini牌的"口水"。 破案过程超级像警匪片️
DeepSeek R2:中国AI巨头遭遇瓶颈还是酝酿大招
大家是不是都还记得去年DeepSeek R1模型发布的时候,那可真是震惊了全世界,连全球股市都跟着抖了几下!当时好多人都觉得,是不是我们之前太高估电脑的推理能力了(不过也有人怀疑DeepSeek是不是偷偷用了比他们宣称的更多的算力来训练模型)。但不管怎么说,DeepSeek R1的出现,就像是给全世
为啥DeepSeek-V3本地跑这么费劲?
为啥 DeepSeek-V3 模型在云上服务时又快又便宜,但你自己在家用电脑跑的时候却又慢又贵? 想象一下,你去吃自助餐。餐厅里有个超级大厨(就像GPU,电脑的“计算大脑”),他炒菜超快,但有个毛病:他懒得炒一小份菜。给他一堆食材,他能“唰唰唰”一次炒出一大锅好吃的,
谁说LLM不会思考?DeepSeek边写代码边调试
苹果说LLM不能思考。这个团队自己只做了一个调试-它打破了每一个基准。这个团队将执行反馈连接到LLM的生成循环中。它运行,读取跟踪,调试.就像一个真实的开发。打破了OpenAI、谷歌、DeepMind的所有基准。 苹果论文:LLM大模型不像开发人员那样思考?错,大语言模型终于学会像程序员一样边写边跑
AI从训练卷到推理秀,现在玩的是速度与激情!
【AI技术进化史:从训练卷到推理秀,现在玩的是速度与激情!】 [b](一)训练时代:AI的"高考备战期"[/b] 以前大家聊AI就像讨论高考——天天比谁家模型刷题(训练)更狠!90年代到2010年代,LeCun、Krizhevsky这些学霸用CNN证明:神经网络做题(处理任务)比传统方法强多了!但当
29个油管视频:如何从头开始构建DeepSeek
以下是这 29 个视频及其标题: (1)DeepSeek系列介绍 (2)DeepSeek 基础知识 (3)代币进入 LLM 架构的旅程 (4)1小时讲解注意力机制 (5)自注意力机制——从零开始手写 (6)因果注意力
细胞“神探”DeepSeek-R1:智能解锁生物奥秘
Deepseek-R1模型预测随机单细胞数据的准确率为38%,点击标题 这篇论文讲了一个超酷的生物研究,就像是给细胞们做“户口普查”! [b]细胞的“户口普查”是个大难题![/b] 你想想,我们身体里有各种各样的细胞,它们就像是不同职业的人,有的
DeepSeek-R1-0528跻身SciArena五强!唯一开源
DeepSeek-r1-0528在新的SciArena基准测试中排名前5,是唯一的开源AI。 --- ## 当AI学霸们组团搞科研,谁才是文献界的"最强王者"? 现在的科学论文就像春天的竹笋一样"蹭蹭"往外冒,教授们看文献看得头都大了!这时候,一群叫"基础模型"的AI学霸站出来说:"放着我来!"但问
上页
下页