Dojo
话题
新佳
订阅
极道
元认知
元逻辑
元设计
元编程
元语言
大语言模型LLM
Jlama:基于Java 20+大模型LLM引擎
Jlama 是一个基于 Java 的推理引擎,适用于 huggingface 上的许多文本到文本模型:Llama 3+、Gemma2、Qwen2、Mistral、Mixtral 等。 它旨在用于将 gen ai 集成到 java 应用程序中,就是可
能写者能思考;不能写者不能思考
保罗·格雷厄姆(Paul Graham)在他的新文章中表示,人工智能将产生负面影响,把人们分成两个世界: 能写的人能思考 不能写的人不能思考 写作虽是一项困难的技能,但它是清晰思考的关键
不需要语言也能思考?
来自《科学美国人》的文章《你不需要语言来思考》探讨了语言和思维之间的关系,特别是语言
Transformer其实是一种集合Set处理器
Transformers的一个常见误解是认为它们是一个序列处理架构。其实不是,他们是一个“集合处理(set-processing)”架构。Transformers是100%顺序不可知的(这是与RNN相比的重大创新)。 Transformer模型在处理序列数
Ministral 8B:比Mistral 7B LLM 更强大
Mistral AI 推出 Ministral 8B,这是其广受欢迎的 Mistral 7B LLM 的更强大的继任者。8B 级 Ministral 总体成绩最好,尤其是在知识、常识和多语言技能方面。 法国人工智能初创公司 Mistral AI 宣布了两种
Claude最新范式Computer Use讨论
Claude 现在可以使用电脑了。最新版本的 Claude 3.5 Sonnet在经过适当的软件设置后,可以按照用户的命令
苹果智能:本地AI代理框架CAMPHOR
苹果的人工智能研究团队推出了 CAMPHOR,这是一个新的人工智能框架,旨在在移动设备上本地处理复杂的用户查询,同时保护用户隐私。 苹果的本地 AI 代理框架CAMPHOR为更有用的 Apple Intelligence 铺平了道路。
大语言模型其实与语言几乎没有关系
大型语言模型(LLMs)的核心能力在于处理和预测一系列离散的标记(tokens),而不仅限于自然语言中的单词或短语。这种能力使得LLMs可以被应用于多种领域,包括图像处理、音乐生成、药物发现等,只要这些领域的问题能够被转化为标记流的建模问题。
Transformer与卷积、Hopfield和状态空间关系
Transformer 架构已在各种神经网络模型的背景下得到广泛讨论,包括它们与卷积神经网络 (CNN)、Hopfield 网络和状态空间模型的关系。以下是最近关于这些主题的研究的主要见解的总结。 1、
OpenAI o1工作原理简介
OpenAI的O1是如何工作的? 这里是我最近读过的关于LLM推理的论文摘要列表。 我将它们分为2类:1)基于提示的-执行一步一步的推理自我纠正流程纯粹使用提示2)基于学习的-将上述内容烘
Anthropic推出有计算机技能的更智能Claude
Anthropic 宣布对其 Claude AI 模型进行升级,包括增强型 Claude 3.5 Sonnet 和新版 Claude 3.5 Haiku。该公司还推出了一项新功能,使模型能够直接与计算机界面交互。 升级后的 Claude 3.5 Sonne
Opus和Sonnet在”我的世界“游戏中有趣故事
使用这个项目,我们在 minecraft 服务器中添加了 Claude 3.5 Sonnet 和 Opus。
微软发布高效 1 位语言模型框架
微软研究院和中国科学院大学的研究人员推出了 BitNet b1.58,这是一种 1 位语言模型,有望在大幅降低成本和功耗的同时实现高性能。 1Bit 大语言模型称为1位大型语言模型(1-bit Large Lang
Perplexity为企业推出“内部知识搜索”
人工智能搜索工具 Perplexity 正在为其 Pro 和 Enterprise Pro 订阅用户推出一项新的“内部知识搜索”功能。此功能允许用户同时搜索公共网络内容和内部知识库,从而有可能加快信息检索速度。 首席执行官 Aravind Srinivas
Meta试图超越OpenAI o1的推理形式
Meta 正在探索超越 OpenAI 最新模型的数学重点的不同形式的人工智能推理。 尽管“广大公众”可能认为人工智能中的推理是一个单一的概念,但它实际上包含了几种因应用而异的类型: 数学推理:解决数学问题 规划推理:制定策略和计划
Meta 正在秘密开发自己的搜索引擎
Meta 正在开发自己的网络搜索引擎,以使其更加独立于 Google 和微软的 Bing。该技术将主要用于向公司自己的 AI 聊天机器人提供最新信息。 据 The Information 援引一位熟悉该项目的人士的话报道,Meta 正在开发一种搜索引擎,该
本周AI前沿:纽约时报起诉Perplexity等
每周 AI 更新(10 月 16 日至 10 月 22 日):来自 Perplexity、Anthropic、Nvidia、Mistral、Meta、Google 等公司的重要新闻: 过去一周的主要更新。 《纽约时报》起诉 Perplexi
英伟达用新训练方法改进了Llama模型
Nvidia 推出了一种新的大型语言模型,该模型在对齐基准测试中的表现优于其他模型。该公司通过结合评估和偏好模型的特殊训练程序实现了这一目标。 新模型名为 Llama-3.1-Nemotron-70B-Instruct,基于 Meta 的开源 Llama
上页
下页