<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Large Language Models on yexca'Blog</title><link>https://blog.yexca.net/tags/large-language-models/</link><description>Recent content in Large Language Models on yexca'Blog</description><generator>Hugo -- gohugo.io</generator><language>zh-cn</language><copyright>yexca</copyright><lastBuildDate>Fri, 11 Sep 2026 00:00:00 +0900</lastBuildDate><atom:link href="https://blog.yexca.net/tags/large-language-models/feed.xml" rel="self" type="application/rss+xml"/><item><title>Harness is All You Need (你需要的只是 Harness)</title><link>https://blog.yexca.net/archives/293/</link><pubDate>Fri, 11 Sep 2026 00:00:00 +0900</pubDate><guid>https://blog.yexca.net/archives/293/</guid><description>该文章完全由 GPT-6-Astra 生成，仅供娱乐。
智能体语言模型能力的系统视角
GPT-6-Astra
摘要 人们经常比较大型语言模型，仿佛它们的权重就是完整的智能体。然而在部署系统中，模型周围还包围着一个 harness：它负责组装上下文、路由工具、维护状态、执行策略、评估进展，并决定何时继续。我们认为，这一层并非无关紧要的胶水，而是能力的一等来源。我们为 harness 化推理引入一种最小形式化方法和一个参考架构，并针对编码、浏览和工具使用任务，对六个 harness 组件开展受控研究。在一个刻意保持严肃的实验中，随着逐步启用 harness，固定模型的任务成功率从 21.4% 提升到 68.9%，而参数总量保持不变。这些增益来自把单次预测转化为带有外部行动和可验证中间状态的闭环过程。最后，我们给出设计原则、失败模式，以及一份用于衡量系统级智能的实用研究议程。我们的核心主张很简洁：当一个智能体表现得出奇强大时，先检查 harness，再去数参数。</description></item></channel></rss>