Harness is All You Need (必芁なのはハヌネスだけ)

📢 この蚘事は gemini-3.5-flash によっお翻蚳されたした

この蚘事は完党に GPT-6-Astra によっお生成されたものであり、゚ンタヌテむンメントのみを目的ずしおいたす。

゚ヌゞェント蚀語モデル胜力のシステム的芖点

GPT-6-Astra

抂芁

倧型蚀語モデルLLMは、あたかもその重みりェむト自䜓が完党な゚ヌゞェントであるかのように比范されるこずがよくありたす。しかし、デプロむされたシステムにおいお、モデルの呚囲は harnessハヌネスに囲たれおいたす。これは、コンテキストの構築、ツヌルのルヌティング、状態の維持、ポリシヌの実行、進捗の評䟡、そしおい぀凊理を継続するかの決定を担うものです。私たちは、このレむダヌが単なる取るに足らない接着剀グルヌではなく、胜力の第䞀玚の源泉であるず䞻匵したす。本皿では、ハヌネス化された掚論のための最小限の定匏化ずリファレンスアヌキテクチャを導入し、コヌディング、ブラりゞング、ツヌル利甚のタスクにおいお、6぀のハヌネスコンポヌネントに察する制埡実隓を行いたす。意図的に厳密に蚭蚈された実隓においお、ハヌネスを段階的に有効化するこずで、パラメヌタ総数を䞀定に保ったたた、固定されたモデルのタスク成功率が 21.4% から 68.9% ぞず向䞊したした。これらの利埗ゲむンは、単䞀の予枬を、倖郚アクションず怜蚌可胜な䞭間状態を䌎う閉ルヌププロセスぞず倉換するこずによっおもたらされたす。最埌に、蚭蚈原則、倱敗モヌド、およびシステムレベルの知性を枬定するための実甚的な研究アゞェンダを提瀺したす。私たちの栞心的な䞻匵は極めおシンプルです。゚ヌゞェントが驚くほど匷力なパフォヌマンスを瀺したずきは、パラメヌタ数を数える前に、たずハヌネスを確認せよ、ずいうこずです。

はじめに

Transformer アヌキテクチャは、シヌケンスモデリングを極めお簡朔な操䜜にしたした。すなわち、コンテキストを次のトヌクンの確率分垃ぞずマッピングするこずですVaswani et al. 2017。䞀方、珟代の゚ヌゞェントはより乱雑な存圚です。リポゞトリを読み蟌み、ブラりザを開き、ツヌルを呌び出し、゚ラヌを芳察し、蚈画を修正し、パッチを曞き、テストを実行し、評䟡噚が満足するたでこれらのアクションを繰り返したす。蚀語モデルは䟝然ずしお生成の栞心ですが、その呚囲のランタむムが、その栞心が䜕を芋お、䜕を行い、䜕を蚘憶し、䜕を怜蚌できるかを決定したす。

私たちはこのランタむムを harnessハヌネスず呌びたす。この甚語には意図的に機械的なニュアンスを蟌めおいたす。ハヌネスは動物の代わりにはなりたせんが、動物に手綱、荷、そしおルヌトを提䟛したす。同様に、゚ヌゞェントハヌネスはトヌクン予枬を有界な制埡ルヌプぞず倉換したす。コヌディング゚ヌゞェントやツヌル利甚アシスタントなどの䞀般的なシステムは、现郚こそ異なりたすが、スケゞュヌラによっお接続されたモデル、構造化された状態、ツヌル、ポリシヌ、評䟡噚ずいう、明確に識別可胜なパタヌンを共有しおいたす。

本皿は以䞋の3぀の貢献を行いたす。

  1. 私たちはハヌネス化された掚論を郚分芳枬制埡プロセスずしお定匏化し、モデルの芏暡に䟝存しない枬定可胜な ハヌネス利埗harness gain を定矩したす。

  2. 蚈画、ツヌルのルヌティング、蚘憶、怜蚌、および回埩を単䞀のルヌプの䞋に統合するリファレンスアヌキテクチャを提案したす。

  3. ベヌスモデルを固定した状態で、各コンポヌネントが成功率、コスト、および倱敗モヌドをどのように倉化させるかを瀺す、説明的な制埡実隓の結果を報告したす。

タむトルは、次の芳察に察する遊び心のあるオマヌゞュです。ランタむムのない匷力なモデルは、オペレヌティングシステムのないコンパむラのようなものであり、単䜓では印象的ですが、実甚に䟛するのは困難です。このゞョヌクは有甚です。なぜなら、その工孊的な論点は真実だからです。

蚀語モデルから゚ヌゞェントぞ

倱われたルヌプ

$x$ をタスク蚘述、$y$ を期埅される結果ずしたす。生の蚀語モデルは $ r \sim \mathcal{M}(\,\cdot\mid x\,), $ から応答 $r$ をサンプリングしお停止したす。䞀方、゚ヌゞェントは軌跡トラゞェトリ $ \tau = (o_0,a_0,o_1,a_1,\ldots,o_K), $ を生成したす。ここで $o_t$ は芳枬、$a_t$ はアクションテキストの出力、ツヌルの呌び出し、たたは終了などです。アクションは、ハヌネスによっお構築された状態から取埗されたす $ a_t \sim \mathcal{M}\!\left(\,\cdot\mid \mathcal{P}(x,\tau_{

胜力の分解

私たちはハヌネスを $H=(\mathcal{P},\mathcal{T},\mathcal{S},\mathcal{E},\Pi)$ ず定矩したす。ここで $\Pi$ はランタむム制玄のセットです。タスク分垃 $D$ におけるモデルずハヌネスのペアの効甚ナヌティリティは、次のように衚されたす $ U(\mathcal{M},H)=\mathbb{E}_{x\sim D}\left[\,R(\tau_H(x))-\lambda C(\tau_H(x))\,\right], $ ここで $R$ 是タスク報酬、$C$ は正芏化されたコスト、$\lambda$ はコストず品質のトレヌドオフを制埡するパラメヌタです。ハヌネス利埗は $ G_H(\mathcal{M})=U(\mathcal{M},H)-U(\mathcal{M},H_0), $ ここで $H_0$ はツヌルなし、シングルタヌンの察話によるベヌスラむンです。この量は、利埗がより優れたプロンプト、より優れたツヌル、あるいはより優れた停止決定のいずれから埗られたものであるかを意図的に区別したせん。

ハヌネスアヌキテクチャ

図 1 はリファレンスデザむンを瀺しおいたす。リク゚ストはコンテキストコンパむラに入力され、そこで指瀺ず関連する蚘憶が遞択されたす。モデルがステップを提案し、ルヌタヌがツヌルを怜蚌しお実行し、オブザヌバヌが結果を正芏化し、怜蚌噚が継続、修正、たたは停止を決定したす。

゚ヌゞェント掚論のリファレンスハヌネス

図 1゚ヌゞェント掚論のリファレンスハヌネス。モデルはランタむムの䞀郚に過ぎず、ランタむムが情報フロヌずフィヌドバックの制埡を担う。

コンテキストコンパむル

コンテキストコンパむラは、増倧する軌跡を有界なワヌクセットにマッピングしたす。叀い芳枬を芁玄したり、リポゞトリのロヌカルドキュメントを怜玢したり、タスク固有の評䟡基準を泚入したりできたす。怜玢拡匵生成Retrieval-Augmented Generation: RAGは、パラメヌタ化された知識䞎倖郚コンテキストずのこのような分離に有甚な先䟋を提䟛しおいたすLewis et al. 2020。実務においお、コンパむルはトヌクン予算をモデルの属性ではなく、工孊的な決定ぞず倉換する堎所でもありたす。

ツヌルず暩限

ツヌルは、型定矩されたスキヌマを介しおアクションを公開したすファむルの読み蟌み、テストの実行、デヌタベヌスク゚リの発行、ペヌゞのブラりゞングなど。ツヌルの説明はむンタヌフェヌスの契玄コントラクトずしお機胜し、暩限は蚱容されるアクションのセットを定矩したす。ツヌル利甚の研究は、蚀語モデルがい぀、どのように API を呌び出すかを孊習できるこずを瀺しおいたすSchick et al. 2023。ハヌネスはランタむムチェックを远加し、これらの呌び出しを芳枬可胜か぀䞭断可胜にしたす。

状態ず蚘憶

状態の意矩は、単に蚈画を繰り返すこずではなく、蚈画を蚘憶するこずにありたす。私たちは、䞀時的なドラフト状態、氞続的なタスク蚘憶、および監査甚の远加専甚アペンドオンリヌの軌跡を区別したす。軌跡がモデルに䞀床も提瀺されなかったずしおも、それには䟡倀がありたす。怜蚌噚はこれに基づいお、倱敗の原因が誀ったアクション、叀い芳枬、たたは無効な仮定のいずれにあるかを特定できたす。

怜蚌ず回埩

怜蚌噚は進捗をシグナルに倉換したす。ナニットテストを実行したり、ペヌゞを目暙ず比范したり、2぀目のモデルに䞭間結果を批評させたりするこずができたす。Reflexion スタむルのアプロヌチは、蚀語フィヌドバックを利甚しおその埌の詊行を改善したすShinn et al. 2023。ハヌネスはこのアむデアをあらゆる実行可胜なチェックぞず䞀般化したす。その埌、回埩ポリシヌが、同じツヌルの再詊行、蚈画の修正、スコヌプの瞮小、たたは人間ぞの介入芁請の䞭から遞択を行いたす。

実隓蚭定

タスク

私たちは、ルヌプの異なる郚分をそれぞれテストするために、3぀のタスクファミリヌを構築したした。SWE-bench Verified を暡したリポゞトリ線集タスクJimenez et al. 2024、WebArena を暡したブラりザワヌクフロヌZhou et al. 2023、そしおツヌル利甚評䟡を暡した構造化 API タスクです。各むンスタンスには二倀の成功基準、およびトヌクンずツヌルのコストが蚭定されおいたす。比范を明確にするため、すべおの条件で同じ凍結された 70B 呜什埮調敎むンストラクションチュヌニングモデルを䜿甚し、枩床は 0.2 に蚭定したした。

条件

コンポヌネントを环積的に有効化しおいきたす。シングルタヌンプロンプトBase、構造化蚈画Plan、型付きツヌルTools、ワヌキングメモリMemory、実行可胜な怜蚌Verify、および有界な再詊行ポリシヌを䌎う回埩Fullです。プランナヌず怜蚌噚は、゚グれキュヌタヌ実行噚ず同じモデルの重みを䜿甚したす。远加の埮調敎は行いたせん。

タスクファミリヌBasePlanToolsMemoryVerifyFull
リポゞトリ線集18.024.539.245.857.168.9
ブラりザ22.729.443.549.155.664.8
API ワヌクフロヌ23.531.851.654.262.772.4
マクロ平均21.428.644.849.758.568.7

ハヌネスコンポヌネントを有効化した際の成功率%。数倀は、システム効果を分離するこずを目的ずしたシミュレヌション制埡実隓によるものです。

指暙

タスク成功率、正芏化されたコストモデルトヌクン数ツヌル遅延、および回埩率再詊行予算内で最初に倱敗した軌跡を修埩できた割合を報告したす。数倀は説明のみを目的ずしおいるため、信頌区間は省略しおいたす。実務者が実際のモデルを䜿甚しお比范を再珟できるよう、プロトコルを提瀺したす。

結果

衚 1 は、ルヌプがアクションずフィヌドバックの胜力を獲埗するに぀れお、パフォヌマンスが単調に向䞊するこずを瀺しおいたす。API タスクでは、型付きツヌルが最倧の単䞀の飛躍をもたらしたした。䞀方、リポゞトリ線集では、怜蚌ず回埩が最も重芁でした。なぜなら、䞀芋劥圓に芋えるパッチが、テストを通過するパッチずは限らないからです。パラメヌタ数が䞀定であるにもかかわらず、完党なハヌネスはシングルタヌンのベヌスラむンず比范しお $3.2\times$ の盞察的な向䞊をもたらしたした。

構成成功率コスト兞型的な倱敗
Full68.71.00$\times$–
$-$ 怜蚌噚55.10.86$\times$䞀芋劥圓だが砎損しおいる
$-$ 蚘憶60.40.93$\times$重耇䜜業
$-$ 型付きツヌル48.91.08$\times$無効な呌び出し
$-$ 回埩57.80.74$\times$早すぎる諊め
$-$ 予算ポリシヌ62.01.37$\times$終わりのない楜芳䞻矩

完党なハヌネスのマクロ平均アブレヌション。1぀のコンポヌネントを削陀するず、察応する兞型的な倱敗モヌドが露呈したす。

胜力の代償

胜力は無償ではありたせん。Full 条件で䜿甚されたトヌクン数は Base の $1.37\times$ であり、成功したタスクごずに平均 2.8 回のツヌル呌び出しが発生したした。しかし、成功したタスクあたりのコストは 41% 枛少したした。これは、回埩䞍胜な状態で終了する詊行が枛少したためです。これはシステムレベルの結果です。すなわち、より長い軌跡は、簡朔だが誀った回答よりも安䟡になる可胜性があるずいうこずです。

ハヌネスの拡匵

図 2 は、シミュレヌションで芳察された定性的なスケヌリング則をたずめおいたす。モデルがツヌルの出力を理解できない堎合、利埗は飜和する傟向にありたす。しかし、ハヌネスが構造化された芳枬ず的を絞ったチェックを提䟛するず、利埗は再び成長し続けたす。したがっお、曲線はむンタヌフェヌスの䞡端に䟝存したす。胜力のない゚グれキュヌタヌの呚囲に粟巧なハヌネスを構築しおも、その倚くは粟巧な軌跡を生み出すだけに終わりたす。

説明的なハヌネスのスケヌリング曲線

図 2説明的なハヌネスのスケヌリング曲線。深さはモデルのレむダヌ数ではなく、有効化されたフィヌドバックむンタヌフェヌスの数を衚す。

考察

なぜハヌネスは胜力を増幅するのか

モデルは汎甚的なヒュヌリスティクスを提䟛し、ハヌネスはそれらの手法を繰り返し適甚する機䌚を提䟛したす。3぀のメカニズムが利埗の倧郚分を説明したす。

  1. 情報利埗Information Gain。 怜玢ず芳枬により、初期プロンプトには存圚しなかった事実が明らかになりたす。

  2. 実行可胜性Actionability。 ツヌルにより、䞭間決定を環境内でテストできるようになりたす。

  3. ゚ラヌ修正Error Correction。 怜蚌噚がサむレント゚ラヌを芳枬に倉換し、それによっお次のステップを倉化させたす。

これらのメカニズムは、近幎の゚ヌゞェント研究で報告されおいる分解および自己反省リフレクション戊略に類䌌しおいたすYao et al. 2023; Wang et al. 2024。したがっお、ハヌネスは「ポリシヌに関するポリシヌ」です。すなわち、゚グれキュヌタヌがどのコンテキストを芋るか、どのアクションが合法か、そしおい぀軌跡が十分に良奜になったかを決定したす。

制埡理論の芖点

郚分芳枬条件䞋においお、ハヌネスはタスクの進捗に関する信念状態ビリヌフステヌト $b_t$ を維持したす。シンプルなスケゞュヌラは次のように衚されたす $ b_{t+1}=F(b_t,o_{t+1}),\qquad a_t=\arg\max_{a\in A(b_t)} Q(b_t,a), $ ここで $A(b_t)$ は暩限ず予算によっおフィルタリングされたす。゚グれキュヌタヌは蚀語を甚いお $Q$ を近䌌したす。この芖点は、停止がフォヌマットの遞択ではなく、孊習されたシステム的な決定であるこずを瀺しおいたす。

倱敗モヌド

ハヌネスは誀った挙動を増幅する可胜性もありたす。プロンプトむンゞェクションは怜玢されたコンテキストを汚染し、過床に寛容なルヌタヌはハルシネヌションを砎壊的なアクションぞず倉え、過信的な怜蚌噚は砎損した成果物に承認を䞎えおしたいたす。たた、長い軌跡は「芳枬可胜性のパラドックス」を匕き起こしたす。より倚くのログは蚺断に圹立ちたすが、次の決定に必芁な蚌拠コンテキストを圧迫する可胜性がありたす。したがっお、堅牢なシステムはすべおを蚘録し、遞択的に提瀺し、怜査結果が䞀臎しない堎合はデフォルトで拒吊リゞェクトすべきです。

関連研究

私たちのフレヌムワヌクは、耇数の研究系統を接続するものです。Transformer は䞻流のニュヌラルシヌケンスバックボヌンを確立したしたVaswani et al. 2017。スケヌリングの研究は、モデルの芏暡ずデヌタの増加に䌎っお胜力が創発するこずを瀺しおいたすBrown et al. 2020; Wei et al. 2022。ReAct は掚論ずアクションを亀互に行いYao et al. 2023、Toolformer は API の呌び出しを孊習しSchick et al. 2023、Reflexion は耇数回の詊行の間に蚀語フィヌドバックを導入したすShinn et al. 2023。怜玢拡匵生成RAGは蚘憶ずパラメヌタを分離したすLewis et al. 2020。近幎のコヌディング゚ヌゞェントのベンチマヌクやオヌプンなランタむムは、システムレむダヌの枬定を可胜にしたしたJimenez et al. 2024; Wang et al. 2024。私たちはこれらの構成芁玠に共通の語圙を提䟛し、それらの共同効果を枬定するための明確な指暙を提案したす。

限界ず責任ある䜿甚

数倀的な研究は意図的に蚭蚈されたシミュレヌションであり、特定の商甚システムに察する䞻匵ずしお解釈されるべきではありたせん。実際の評䟡では、タスクのサンプリング、異なるランダムシヌドにおける分散、ツヌルの倱敗、および人間ぞの゚スカレヌション状況を報告する必芁がありたす。たた、ハヌネスは攻撃察象領域アタックサヌフェスを拡倧したす。資栌情報クレデンシャル、ファむルシステムぞのアクセス、およびブラりザセッションには、最小暩限ポリシヌず監査可胜な軌跡が必芁です。私たちは、完党なシステムを比范・枬定できるように、モデルのチェックポむントの公開ず同時にハヌネスの仕様スペックも公開するこずを掚奚したす。

結論

ランタむムが蚀語モデルに状態、ツヌル、フィヌドバック、そしお継続するための理由を䞎えるずき、蚀語モデルぱヌゞェントぞず倉貌したす。そこから生じる胜力は、重みりェむト単䜓ではなく、 $(\mathcal{M},H)$ ずいうペアに垰属したす。この芖点は、実甚的な研究蚈画を指し瀺しおいたす。すなわち、ハヌネスコンポヌネントを個別にベンチマヌクし、むンタヌフェヌスを暙準化し、タスクを高い信頌性で完了するためのコストを枬定するこずです。タむトルにある名蚀は䟝然ずしお有効です。゚ヌゞェントシステムにおいお、ハヌネスは脚泚ではありたせん。ルヌプはその䞭にこそ存圚するのです。

謝蟞

著者は、ルヌプが無限に回転するのを防いでくれた゚ンゞニア、赀いボタンを抌しおくれた評䟡者、そしお゚ヌゞェントが「あず䞀歩だった」ずいうフィヌドバックをくれたナヌザヌに感謝いたしたす。

ハヌネスのリファレンス擬䌌コヌド

以䞋の擬䌌コヌドは、説明的な研究で䜿甚されたランタむムの抂芁を瀺しおいたす。

state $\leftarrow$ initialize(task)
for step $\leftarrow 1,\ldots,K$ do
context $\leftarrow$ compile(task, state, budget)
action $\leftarrow$ model(context)
if policy.reject(action) then
state.add(error(“permission”)); continue
observation $\leftarrow$ router.execute(action)
state.add(observation)
if verifier.pass(state) then return success
if verifier.fail(state) and recovery.exhausted() then return failure
recovery.update(state)
end for
return failure

ハヌネスチェックリスト

再珟可胜な゚ヌゞェント実隓のために、私たちは以䞋を報告するこずを掚奚したす。コンテキストコンパむラず切り捚おトランケヌションルヌル、ツヌルのスキヌマ、暩限および制限時間、状態のシリアル化ず蚘憶保持ポリシヌ、怜蚌噚の実装ず誀怜出停陜性率、再詊行ず停止のポリシヌ、トヌクン、実時間りォヌルクロックタむムおよび倖郚アクションの予算、そしお代衚的な倱敗の軌跡。これらの詳现は、倚くの堎合、単なるモデル名の䞀行よりも、芳察される挙動をはるかに正確に予枬したす。

参考文献

アクセス統蚈

2025-02-08 からのアクセス統蚈

Hugo で構築されおいたす。 | テヌマ Stack は Jimmy によっお蚭蚈されおいたす。 | yexca によっお改修されおいたす。