Dojo
话题
新佳
订阅
极道
元认知
元逻辑
元设计
元编程
元语言
DeepSeek时刻
阿里QwQ-32B或超越DeepSeek满血版
今天,我们发布了 QwQ-32B,这是我们全新的推理模型,虽然只有 320 亿个参数,但它能跟顶尖的推理模型,比如 [url=
深度搜索崛起:DeepSeek率先探索成功!
[b]Deepseek引入的[/b]深度搜索成为2025年新标准。各大公司纷纷推出深度研究产品,AI工程师通过整合长期思考与推理,显著提升了搜索系统的性能与深度。 要点: [list] [*]深度搜索DeepSearch经过搜索
本地部署大模型新王者:苹果M3 Ultra
部署本地大模型的新机型王者?苹果M3 Ultra,80 核 GPU,512GB 内存出世!有了 512GB 内存,一切皆有可能。 这是苹果公司(Apple)网站上关于Mac Studio的定制: 产品名称:Mac Studio 处理器: [list] [*]选项1:Apple M3 Ultra芯片,
DeepSeek开源smallpond和3FS指南
你可能在 Twitter/X/LinkedIn 的炒作中偶然发现了[url=
英伟达RTX 4090 96GB显存AI版量产曝光
据报道,NVIDIA 的 GeForce RTX 4090 装了 96GB 的显存;这个显卡可能会很快开始大规模生产,瞄准 AI 工作负载。 报告里说了,真有装了高达 96GB 显存的 RTX 4090,可能会在几个月内卖到市场上。 看来之前传言
抓住显著线索,胜过复杂推理!
信息工作的核心不是光靠逻辑推理牛不牛,而是能不能拿到足够多、足够相关的信息(高信号量上下文)。 例如,在阅读文章时,先看标题、加粗文字或图表等显著信息。 比如律师、医生、企业高管,他们赚钱多,不是因为逻辑多强
法国顶级小模型Mistral Small 3.1发布,比肩阿里千问!
Mistral Small 3.1 是一个很厉害的、真正优秀的本地模型,用的是 Apache 2.0 许可证。现在的 AI 应用需要很多功能——比如处理文字、理解多种类型的输入(比如图片)、支持多种语言、还能处理很长的上下文内容,同时还要反应快、成本低。 Mistral Small 3.1 是第一个
强化学习获图灵奖,DeepSeek落地AI推理
安德鲁·巴托和理查德·萨顿因为搞出了强化学习的理论基础,拿到了2024年A.M.图灵奖。 强化学习是人工智能里好多牛掰突破的关键招数。 在强化学习里,人工智能系统得训练用“奖励”信号来完成任务,这些信号就像路标一样,告诉它们该干啥有用。 20世纪80年代,巴托和萨顿整出了一套数学技术,让这个基本想
Gemma、Mistral、QwQ挑战Deepseek,谁能胜出?
这是Gemma 3 27b vs. 阿里千问QwQ 32b vs. Mistral 24b vs. Deepseek r1测试。 上周,谷歌和Mistral公司分别发布了两个新的人工智能模型,叫做Gemma 3 2
英伟达华硕重磅推出本地部署AI电脑
两款支持大模型本地开发和云部署的新AI计算机发布: [list=1] [*]华硕推出了Ascent GX10 AI超级计算机,搭载NVIDIA GB10 Grace Blackwell超级芯片,性能强大,支持高达1,000 TOPS的AI处理能力和128GB内存,适合处理大型AI模型。 [*]英伟达
DeepSeek smallpond搅动大数据风云
DuckDB 走向分布式?DeepSeek 的 smallpond 涉足大数据DuckDB!降维打击传统大数据领域,搅动中台数据工程风云! DeepSeek 正在利用 smallpond(一种新的、简单的分布式计算方法)推动 DuckDB 超越其单节点根源。但它是
Gemma 3微调提速1.6倍,VRAM节省60%
Gemma 3 现已在 Unsloth 中进行微调 - 速度提高 1.6 倍,VRAM 减少 60% Gemma 3 现已在 Unsloth 中支持微调,显著提升了训练效率。Unslo
谷歌Gemma 3:单GPU性能超DeepSeek
谷歌认为自家Gemma 3是“世界上最好的单加速器模型”,在单个 GPU 上比 Facebook 的 Llama、[url= [/url]和 OpenAI 的模型都强,而且在 Nvidia 的 GPU 和专门的 AI 硬件上也跑得更好。 在发布了两款用和 Gemini AI 一样技术做的“开放式”
睡不好觉,李开复全面拥抱Deepseek
前谷歌中国区负责人李开复正在调整他的人工智能初创公司[url= 李开复在接受《南华早报》采访时表示,他的公司已放弃训练专有大型语言模型的策略,转而完全依赖Deepseek的开源产品。 Deepseek的发布在中国引发了“
2025年推理计算让大模型好像开挂了
这篇文章(点击标题)主要聊的是怎么让大语言模型(LLM)变得更会“推理”,尤其是通过“推理时计算”(inference-time compute)这个方法来提升它们的表现。2025年这块儿特别火,因为推理能力强
阿里小模型QwQ-32B已在股市引起轰动
中国的一家大科技公司阿里巴巴,最近推出了一个叫[url=
Spring AI+DeepSeek构建AI应用教程
在本文中,我们探索了将 DeepSeek 模型与 Spring AI 结合使用。 我们讨论了将 DeepSeek 模型集成到我们的应用程序中的各种选项,其中一种是直接使用 OpenAI API,因为 DeepSeek 与它兼容,另一种是使用亚马逊的 Bedrock Converse API。此外,我
12条用DeepSeek写作提示秘笈
Deepseek如何帮助我写和出版一本书,有12个简单的提示: 1. 头脑风暴和提纲 “写一本关于[主题]的书,目标读者是[目标受众]。帮我头脑风暴一些独特的角度,并创建一个详细的章节提纲。” 2. 角色和叙事框架 “为一本关于[主题或话题]的书开发主要角色或叙事线索。包括动机、冲突和结局。” 3.
上页
下页