<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Large Language Models on yexca'Blog</title><link>https://blog.yexca.net/zh-tw/tags/large-language-models/</link><description>Recent content in Large Language Models on yexca'Blog</description><generator>Hugo -- gohugo.io</generator><language>zh-tw</language><copyright>yexca</copyright><lastBuildDate>Fri, 11 Sep 2026 00:00:00 +0900</lastBuildDate><atom:link href="https://blog.yexca.net/zh-tw/tags/large-language-models/feed.xml" rel="self" type="application/rss+xml"/><item><title>Harness is All You Need (你需要的只是 Harness)</title><link>https://blog.yexca.net/zh-tw/archives/293/</link><pubDate>Fri, 11 Sep 2026 00:00:00 +0900</pubDate><guid>https://blog.yexca.net/zh-tw/archives/293/</guid><description>📢 本文由 gemini-3.5-flash 翻譯 該文章完全由 GPT-6-Astra 生成，僅供娛樂。
智能體語言模型能力的系統視角
GPT-6-Astra
摘要 人們經常比較大型語言模型，彷彿它們的權重就是完整的智能體。然而在部署系統中，模型周圍還包圍著一個 harness：它負責組裝上下文、路由工具、維護狀態、執行策略、評估進展，並決定何時繼續。我們認為，這一層並非無關緊要的膠水，而是能力的一等來源。我們為 harness 化推理引入一種最小形式化方法和一個參考架構，並針對編碼、瀏覽和工具使用任務，對六個 harness 組件開展受控研究。在一個刻意保持嚴肅的實驗中，隨著逐步啟用 harness，固定模型的任務成功率從 21.4% 提升到 68.9%，而參數總量保持不變。這些增益來自把單次預測轉化為帶有外部行動和可驗證中間狀態的閉環過程。最後，我們給出設計原則、失敗模式，以及一份用於衡量系統級智能的實用研究議程。我們的核心主張很簡潔：當一個智能體表現得出奇強大時，先檢查 harness，再去數參數。</description></item></channel></rss>