• Claude Code跑8分钟,OpenCode跑3分钟,Pi跑2分钟,质量一样 同一个DeepSeek V4 Flash模型,修复同样的八个代码缺陷,Claude Code平均耗时8.0分钟,OpenCode耗时3.1分钟,Pi耗时2.1分钟。质量得分Claude Code是2.42,OpenCo
  • Hermes Agent 现在可以读取您提供的任何文件:PDF、Word、PowerPoint、Excel、OpenDocument、RTF、EPUB——所有文件都会在 Agent 读取文件的那一刻自动转换为简洁的 Markdown 格式,而且所有转换都在本地完成! 这是由全新开源 anydoc(R
  • 一个开源模型换个调用工具就像换了颗脑子,任务执行效率原地起飞,这到底是黑科技还是认知错觉? 同一个DeepSeek V4 Flash模型,从OpenCode换到Codex Harness,任务执行力飙升,连输出质量都上了一个台阶。这不是模型本身变强了,而是外围控制框架彻底改变了模型的行为表现。本期拆 icon
  • 这是ycombinator公司内部工作人员使用的智能体,现在开源了,这一台AI顶十个人?一个团队账号让所有人共用AI助手,这操作谁受得了? QM(A multiplayer agent harness for work) 是一个面向企业和创业团队的多用户 AI Agent 平台。它的核心理念不是让每 icon
  • 训练会杀死创造力,把AI变成另外一个搜索引擎,但后训练每天用强化学习重新发明人类思维,难道这不算另一种更狠的格式化。 AI圈最近三年在卷什么,后训练。 这词2024年就有人喊了,但真正让所有人疯了一样砸钱砸人砸显卡的是2025下半年之后。 OpenAI后训团队 icon
  • SimpleEnglish是一个Agent技能包,通过把ASD-STE100的53条写作规则编入提示词,让LLM输出符合航空级技术写作标准的英文文档,让AI的废话和模糊表达当场死亡。 你对着AI喊了三个月的“写清楚点”,它回你一堆“seamlessly”和“leverage”。现在有个东西能让它闭嘴 icon
  • Hermes Agent 现在对弱鸡模型友好到离谱,本地跑 AI 再也不怕卡成 PPT 了。 2026 年 8 月 3 日,Hermes Agent 背后的大脑 Teknium 扔出一组数据,直接把 AI 代理优化这件事从“修修补补”拉到了“认知重构”的层面。借助英伟达 Nemo Relay 的观测 icon
  • 烧掉你所有token的,从来不是模型本身,而是它背后那张看不见的图。 当Fable在Terminal-Bench上砍下83.1%,当GPT-5.6 Sol冲上88.8%,当Ultra模式把数字再次推高到91.9%,一个更残酷的问题浮出水面:为什么你的token限额总是先于任务完成而消失?答案藏在这些 icon
  • 科学界藏着一个不能说的秘密:我们其实根本不懂怎么搞科研。 谷歌四位顶级AI专家——Jeff Dean、Sanjay Ghemawat、Oriol Vinyals和Quoc Le——集体离职,创立AI初创公司Discovery Loop。 公司旨在利用AI自动化科学实验循环,在芯片设计、药物发现、材料 icon
  • 如何递归地改进你的智能体? 一个开局只有70分水平的智能体,丢进一个自动化的“自我递归”循环里,反复用自己跑出来的报错数据折磨自己,直到所有考试全部满分。这个过程的恐怖之处在于:它不需要你熬夜修bug,只需要你按下启动键然后去睡觉。 ### 一条流程图把整个工程队装进四个斜杠命 icon
  • AI写代码速度暴涨300%,但你的代码库正在变成一坨定时炸弹,你敢不敢关灯让它自己跑? AI编程助手让代码产出爆炸,但软件质量正在雪崩。Faros AI报告显示事故率飙升242%,PR审查质量跌入谷底。关灯工厂、强化学习、代码可维护性、SWE-bench测试集,这些概念正在撕裂开发团队。你以为在加速 icon
  • 你给AI喂了一整年的聊天记录,结果它把你上周说的话和两年前的话混在一起回答你。这叫记忆吗?这叫垃圾堆。 AI的记忆不是存得多就叫好。存得越多,错得越离谱。一个Agent如果记住了你所有的废话和矛盾,它反而什么真话都说不出来了。真正的记忆工程,不是让AI记住一切,而是让它知道该忘掉什么。 人类靠忘事才 icon
  • AI 把代码变便宜了,结果大家反而往死里堆东西。堆得越狠,花钱越猛。有人偏要反着来,结果省了钱还赢了比赛。 AI 编程工具现在卷得跟军备竞赛一样。提示词越写越长,工具越塞越多,层数越堆越高。大家都觉得功能多就等于性能好。但有一款叫 Pi 的编码工具,出门就带四个家伙事儿,系 icon
  • 2026年7月24日,Fable 5一天规划完平时三周的活,Opus 4.8直接开干,GPT 5.6 Sol呢?专门负责搞破坏。这套组合拳下来,你猜怎么着?代码质量反而爆表了。 以前是一个人闷头写代码,现在是三个AI各司其职,互不干涉。一个定方向,一个执行,一个专门挑刺。这种模式下,AI编程团队配合 icon
  • Kubernetes 启动 AI 环境慢了 4 倍,你还把它当宝? Kubernetes 是云原生时代的王者,但在 AI 智能体工作负载面前,它可能是个穿着西装的慢郎中。一项针对 500 次环境启动的基准测试显示,在需要快速拉起不同环境的 AI 基础设施场景下,专用沙盒工具 Daytona 的中位启 icon
  • 导语:程序员们,扎克伯格今天扔了个代码炸弹。你们以为又是套壳工具?这次是能在你电脑终端里连着干24小时不喘气的玩命智能体。 Meta刚刚放出Muse Code测试版,一个能在巨型代码仓库里自己规划改动、写代码、跑验证的终端智能体。背后的Muse Spark 1.2模型在英伟达Hopper上连续调用超 icon
  • 给AI代理团队当经理,比管人类更心累,但产出能翻三倍,你敢信? 管好AI代理的关键,不是催它们干活,而是教它们自我验证。本文用早餐工厂作比喻,拆解管理AI代理的核心概念:限速步骤、吞吐量、质量控制和经理杠杆,并结合Cursor公司的真实案例,展示如何构建可信赖的自动化循环。 管理AI代理就像管一 icon
  • 吃饱了撑的才信AI自己会干活! OpenClaw加三层定制包装,一个管流量闸门一个管任务清单一个管记忆体,两个月跑下来发现AI干活最要命的问题是它干砸了连个屁都不放。 OpenClaw的开源架子两个月前被一个搞创业的人捡起来往上面糊了三层东西: 第一层是个路由闸门 routing/gateway icon