Dojo
话题
新佳
订阅
极道
元认知
元逻辑
元设计
元编程
元语言
大语言模型LLM
用第一性原理引导AI思路:跳出模式匹配局限
在使用大模型时,应该从第一性原理(First Principles)思考,而不是依赖过去的模式匹配,可以帮助我们更好地预见和应对未来的变化。这种方法强调从最基本的原理出发,重新构建对问题的理解,而不是简单地依赖过去的经验或现有的框架。 以下是对这一观点的详
AI自动吐代码:Context决定成败
关于用大型语言模型(LLM)帮忙写代码的网上讨论,总会有一些开发者跳出来说他们的体验很糟糕。他们常常问自己到底哪里做错了——为什么有些人说效果特别好,而他们自己试了却发现问题一大堆? 用LLM写代码其实挺难的,也不那么直观。要想搞清楚怎么用它、什么
法国顶级小模型Mistral Small 3.1发布,比肩阿里千问!
Mistral Small 3.1 是一个很厉害的、真正优秀的本地模型,用的是 Apache 2.0 许可证。现在的 AI 应用需要很多功能——比如处理文字、理解多种类型的输入(比如图片)、支持多种语言、还能处理很长的上下文内容,同时还要反应快、成本低。
Gemma、Mistral、QwQ挑战Deepseek,谁能胜出?
这是Gemma 3 27b vs. 阿里千问QwQ 32b vs. Mistral 24b vs. Deepseek r1测试。 上周,谷歌和Mistral公司分别发布了两个新的人工智能模型,叫做
AI拒写代码,反怪程序员逻辑不行
人工智能编码助手 Cursor 最近做了一件挺有意思的事,它告诉一个叫“janswist”的用户,让他自己写代码,而不是依赖 Cursor 帮他完成。这让我们看到了机器人在工作中也能有自己的“态度”。 事情是这样的:janswist 用 Cursor 这个
廉颇老矣,AI教父杨立昆掉在认知陷阱里出不来了
AI教父杨立昆(Yann LeCun)最近在访谈中说:我们无法仅通过扩大 LLM 规模就获得人类水平的人工智能。他一直多次唱空语言模型,这次是否猜中了,还是类似上海爷叔对股市的预测? 在完整的播客里,他解释说,他认为“推理”是建立在 LLM(大型语
文明转向:注意力转向大模型而非人类
Andrej Karpathy认为:现在大部分内容还是写给人类看的,而不是给LLM(大型语言模型)用的。 他认为:2025年应该开始转变为:99.9%的注意力将会是LLM的注意力,而不是人类的注意力。
Gemma 3微调提速1.6倍,VRAM节省60%
Gemma 3 现已在 Unsloth 中进行微调 - 速度提高 1.6 倍,VRAM 减少 60% Gemma 3 现已在 Unsloth 中支持微调,显著提升了训练效率。Unsloth 通过优化算法和硬件适配,使微调速度提高了 1.6 倍,同时
模型上下文协议MCP简单解释
模型上下文协议(MCP)就像是AI应用程序的“万能插头”——USB-C接口。就像USB-C可以让你用同一个接口连接各种不同的设备一样,MCP也让你的AI应用程序能够用一种标准化的方式连接到各种各样的数据源和工具。接下来,我们用大白话一步步解释MCP是啥。
氛围感编程的12条黄金法则
在使用大模型自动生成代码时需要注意的12大陷阱,可作为AI自动编程和Vibe编程的最佳实践,将氛围感拉满: 1、你要停止挖掘现在的AI模型在遇到问题时,不太懂得停下来思考。比如说,你想做一个功能X,但在做的过程中发
谷歌Gemma 3:单GPU性能超DeepSeek
谷歌认为自家Gemma 3是“世界上最好的单加速器模型”,在单个 GPU 上比 Facebook 的 Llama、DeepSeek和 OpenAI 的模型都强,而且在
睡不好觉,李开复全面拥抱Deepseek
前谷歌中国区负责人李开复正在调整他的人工智能初创公司01.AI,全面采用Deepseek的开源模型,并认为这对OpenAI的商业模式构成了挑战。
Crane:类似llama.cpp实现本地运行模型
基于纯 Rust 的 LLM 推理引擎,由 Candle 框架提供支持。 Crane 专注于利用 candle 框架中内核的强大功能来加速 LLM 推理速度,同时减少开发开销,使其在 CPU 和 GPU 上都具有可移植性和快速运行模型。 <
openai-agents:OpenAI智能体Swarm升级
OpenAI今天发布的另一项重大公告:用于构建“代理/智能体/agent”的 Python 库( openai-agents),以替代他们之前的swarm 研
英伟达2025 GTC扔出六项重磅AI技术
Nvidia 在 2025 年的 GTC 大会上推出了一堆新产品和新技术,准备迎接 AI 推理的新时代。这次发布会的重点是 BlackwellUltra 平台。
AI下一步:模型就是产品
过去几年,大家都在猜人工智能下一步会怎么发展。是搞代理智能体?推理机?还是真正的多模态? 我觉得现在可以这么说:模型本身就是产品。 现在的研究和市场发展都在往这个方向走:
谷歌发布全新Gemma 3小模型系列
Google Deepmind 推出了一个叫 Gemma 3 的新一代开放式 AI 模型。这个模型的特点是占用空间小但性能高,所以它可以在单个 GPU 或 TPU 上运行。 Google Deepmind 说,虽然这些模型体积小,但在初步测试中,它
在Docker中将能运行本地AI模型
Docker Model Runner 通过消除复杂设置、处理依赖项和优化硬件,使运行大模型 LLM 变得毫不费力 为基于云的推理提供安全、低延迟的替代方案,所有这些都无缝集成到 Docker Desktop 中。 直接从 Dock
上页
下页