• 美国开发者用中国开源模型GLM-4.7,是因为便宜、能本地部署、满足基础需求;但Claude Code已实现自动长时间写代码的"编程AGI"能力,两者不是直接竞争,而是分层满足 different 需求。 未来AI生态将分三层:全自动Agent(美国主导)、高级助手(美国主导)、开源本地模型(中国主
  • 我妈今年五十七岁,是个肾移植病人,住在华东一座小城。每隔几个月,她就得背着换洗衣服、一摞化验单和几个煮鸡蛋,坐一个半小时高铁去杭州看病。这趟旅程得花整整两天。第二天一早七点,她就得跟几百号人挤在医院走廊里抽血,那场面热闹得像个菜市场。下午拿到结果,她才能见到专科医生,聊个三分钟,运气好的话能撑到五分
  • K2 甚至比 DeepSeek v3 更强大,可以与 Claude Opus 4 和 GPT-4.1 相媲美! Kimi K2是一个最先进的混合专家(MOE)语言模型,拥有320亿个激活参数和1万亿个总参数。经过Muon优化器的训练,Kimi K2在前沿知识,推理和编码任务方面实现了卓越的 icon
  • 老黄CES亮出新存储层ICMSP,GPU秒扩上下文;DeepSeek Engram把SSD当内存用;Claude Code催生常驻记忆需求,三箭齐发闪迪需求直接加一成,股价狂飙。 黄仁勋的ICMS、DeepSeek的Engram、Claude Code的长期工作记忆,本质上都在干同一件事:让AI拥有 icon
  • 来自华为github帖子,原文点击标题: 各位好,我是一名盘古大模型团队,华为诺亚方舟实验室的员工。 首先为自证身份,列举一些细节: [list] [*]现诺亚主任,前算法应用部部长,后改名为小模型实验室的主任王云鹤。前诺亚主任:姚骏(大家称姚老师)。几个实验室主任:唐睿明 icon
  • DeepSeek凭借零外部融资、无商业化压力的独特模式,在资本狂潮中保持纯粹AGI研究方向,形成难以复制的组织与战略优势。 DeepSeek 真正的护城河不是模型能力、开源程度或价格,而是彻底没有商业模式与外部资本约束,从而实现极致内部一致性,把全部资源押注在长期 AGI 研究本身。 一年前,202 icon
  • AMD基于DeepSeek工程师开源的nano-vLLM,打造专属推理引擎ATOM,针对MI355X显卡和DeepSeek、Qwen、Llama等模型深度优化,在中高并发场景下吞吐量超越NVIDIA Blackwell B200,尤其在DeepSeek-R1上实现1.4倍性能提升。 AMD搞了个叫 icon
  • 月之暗面最近甩出一份30页的技术报告,厚度堪比高中数学课本,但这玩意儿可比课本刺激多了。报告里埋着几个足以让传统AI训练观念当场去世的反常识发现,每一个都在喊:你们之前的路走偏了。 这份报告的核心目标只有一个,就是搞定通用智能体智能(General Agentic Intelligence),也就是 icon
  • 大模型也能“查字典”?新架构Engram让AI推理快如闪电 !DeepSeek提出“条件记忆”新范式Engram,通过O(1)哈希查表替代早期层静态知识重建,释放注意力资源,显著提升推理、代码与长上下文能力。 这篇论文由北京大学与深度求索(DeepSeek AI)联合团队完成,核心作者包括程鑫、曾旺 icon
  • 从今天起,LM Studio 在家和工作中均可免费使用。查看更新后的条款了解详情。我们的隐私政策保持不变,您可以在此处阅读。 < icon
  • 中国科学家搞出大新闻!全球首个"记忆操作系统"MemOS横空出世,AI这下真要有"人脑记忆"了! 上海交大、浙大的学霸天团最近整了个黑科技 icon
  • Mistral CEO透露Mistral于2024年初率先发布稀疏专家混合模型架构,DeepSeek-V3正是在此基础上开发而成,双方技术互通。他认为开源模式让研发效率倍增,中国内部知识共享机制高效,而美国公司投入开源不足 icon
  • 在所有六项任务中,Kimi K2的优势是毋庸置疑的: 它写的故事超有文采,各种高级隐喻信手拈来,结构清晰,主题还特别宏大!该模型显示了对文学工艺的复杂掌握,始终如一地提供充满隐喻,结构连贯,主题雄心勃勃的故事。 它最大的特点是它能够轻松地整合不同的提示,将物体和符号编织成分层的叙事功能,并将复杂的想 icon
  • 用打游戏升级的套路教你调教AI大模型!PPO/DPO/ORPO/GRPO算法全解析 【作者】Mehul Jain --- ### 当AI大模型遇上强化学习:像训练宠物一样调教 icon
  • 这篇文章是Kimi K2发布后不久,Kimi团队成员写的个人反思。 ·超越聊天机器人:Kimi K2实验了一种“工件优先”的交互模型,该模型让AI立即构建交互式前端可交付成果--如PPT页面、图表,甚至是小游戏--而不是简单地返回markdown文本。 ·工具使用,减少痛苦:团队没有将无数的第三方工 icon
  • Phi-4-mini-flash-reasoning 是一个基于合成数据的轻量级开放模型,专注于高质量、推理密集的数据,并进一步优化以实现更高级的数学推理能力。该模型属于 Phi-4 模型系列,支持 64K 的 token 上下文长度。 Phi-4-mini-flash- icon
  • 考虑到像K2这样强大的模型可以在托管平台上廉价地获得,并且具有很高的推理速度,您是否后悔为LLM投资硬件? 现在网上租的AI模型又猛又便宜,速度还快得像闪电侠!你砸钱买高端电脑跑本地AI,肠子悔青没? 我之前也用Mac笔记本跑AI,结果M4 Pro芯片带不动那些巨无霸模型,直接弃疗!现在? 真香— icon
  • 【震惊!】开源界突然空降"Claude 4杀手"——Kimi K2模型! 这玩意儿到底有多猛?给大家划重点: 参数规模突破万亿大关(相当于960GB的超级大脑),比隔壁Deepseek v3的6710亿参数还豪横 运行配置要求惊人:想玩转它得准备10-12张H100显卡,或者16张A100(普通玩家 icon