NOIA_GRIDKNOWLEDGE ARCHIVE
← RESEARCH CODE / 分析カード

独立カード · 見る軸

Agentの成果を外部状態で確かめ、構成の寄与を分ける

NOIA:LENS:VERIFIED-AGENT-CONTRIBUTION@0.1.1

試験中・回答品質は未評価。AIによる編集候補であり、著者の正式な理論登録・編集承認ではありません。

何を見るためのカードか

Agentの自己申告やModel単体の評価と、対象環境で確認された成果を分ける。目的、観測された状態、実行した操作、独立Verifierの結果を対応付け、Model・Harness・Memory・Tool・Environment・Computeの変更を分けた比較から、どの構成が成果や費用の差へ関係したかを調べる。HarnessとMeta記事を一般化したAIによる編集候補で、構成の複雑さや部品数を品質点数にはしない。

Agentの完成報告やモデル順位で実務能力を代用せず、実際にできたことと、構成変更に帰属できる差の範囲を評価する。

調べる手順

  1. 目的と最終状態・成果物、独立した受け入れ基準、比較条件と予算を固定する。実行に必要な状態が観測可能かを確認する。
  2. 観測された状態→実行した操作→外部状態の変化→Verifierの判定を、記録・時刻・成果物へ対応付ける。未実行の計画や自己申告を実行記録から分ける。
  3. 成功・失敗・再試行と検証費用を含め、固定構成で確認された品質・時間・費用を示す。検査していない品質軸を明記する。
  4. 構成の寄与を問う場合はModel・課題・入力・予算等をそろえ、Harness等の変更点を分けた比較を求める。そろわない差は未確定の寄与として残す。
  5. 最適化に使った課題と独立評価の課題を分け、成功例だけの選別やVerifierへの過適合を点検する。未知課題の結果がない場合は転用効果を未確認とする。
  6. 外部状態で確認できた成果、比較から帰属可能な差、交絡、Verifierの限界、判断を変える追加評価を返す。
  7. 回答にはapplicable / inapplicable / needs_input と、外部判定条件や比較入力の充足状況。
  8. 回答には目的・状態・操作・成果物・独立検証をつないだ証拠表と、未検証の範囲。
  9. 回答には固定構成の結果、変更点と比較条件、構成寄与の確定/未確定、失敗と費用を含む評価表。

使う前に確かめる条件

必要な入力

  • 対象課題、期待する最終成果・状態、成功/失敗と品質の判定基準、情報基準日と評価期間。
  • Model・Harness・Prompt・Memory・Tool・Environmentの版、利用可能な操作と権限、入力データ、計算・時間・再試行・検証の予算。
  • 実行前後の外部状態、操作・Tool結果・Error・Diff・Test等の実行記録と、成果物や環境を独立に確認するVerifier。
  • 寄与を比較する場合は、同一課題・Model・入力・予算等を保った基準構成と変更構成、変更点、試行条件、失敗を含む結果。最適化に使った課題と評価用課題の区別。

使える条件

  • CodingのTestと成果物、Browserの操作後状態、3DのSceneやRenderなど、対象成果を自己申告の外で確認できる場合。
  • 観測・操作・結果を対応付けられる固定構成の評価。構成変更の寄与は、比較条件と変更点を特定できる範囲で扱う。
  • 改善Loopがなくても、単独構成の成果確認と複数構成の比較に使える。

適用できない条件・限界

  • 外部の成果条件やVerifierがない場合はneeds_inputとする。確認できた操作と未検証の完成を分け、自己評価だけで成功にしない。
  • Model・入力・Tool・予算等が同時に変わる比較からHarnessだけの効果を断定しない。切り分けができない場合は構成全体の差と未確定の寄与を返す。
  • Verifierの合格は検査した範囲の合格。品質の全側面や安全性を保証しない。受け入れ基準の欠落、誤った報酬、検証への過適合も点検する。
  • 探索中に見た課題だけでの良化は未知課題への転用を証明しない。最適化用と評価用の重複が不明なら汎化は未確認とする。
  • 元記事のfや不等式は関係を整理する概念表現であり、校正された性能公式ではない。原研究の改善値をこのカードの効果量として扱わない。
  • 意味構造や内部Stateは有用な観測候補だが、更新遅れ・欠落・誤りがあり得る。可視情報の少なさだけで安価または正確と結論しない。

入力が足りない場合

  • 必要入力や根拠が不足する場合はneeds_inputとし、不足項目・理由・次に調べる資料を返す。未知を0や成立へ置き換えない。
  • 対象・比較条件・単位が適合しない場合はinapplicableとし、元記事の倍率や結論を流用しない。確認済みの範囲と未確認の範囲を分ける。

元記事の固定した根拠

引用の内容と、このカードで編集した定義を分けて確認できます。各リンクは保存した本文の版と段落を指します。

1. AI Agentの「Harness」とは何か → 原文の段落

役割:trajectory_and_external_verifier / 語り手:解説本文

1. **Environmentを決める。** CodingならRepo+Shell+Test、WebならBrowser、3DならBlenderなど。
2. **Actionを少なくする。** 最初はBash一つでも構わない。
3. **ReAct Loopを作る。** Model → Action → Observationだけ。
4. **Raw Trajectoryを全部保存する。** Prompt、Tool Call、Error、Diff、Test resultを残す。
5. **Verifierを作る。** Agent自身の「完成しました」を信用せず、Testやworld stateで確認する。
6. **SandboxとPermissionを入れる。**
7. **長時間化して初めてCompaction・Memoryを入れる。**
8. **本当に必要になってからSubagentを追加する。**
9. **失敗Traceを見てACIを改善する。**
10. **最後にRLや自動Routingを導入する。**
固定した根拠の識別情報
記事の版
rev_f242ed66-42d3-401c-8511-3cf2afb7e533
段落
blk_5614d979-e697-4bd3-8a52-6a45c8a628b5
本文パッケージ SHA-256
438dedb4b52a2764a892419d6c13912814764d4e3342f1c176ffb05f854a0247
段落 SHA-256
24ae45728100f365daef2b56cef018880fa84bc51a6c9ddb5947d125797fb06c

2. AI Agentの「Harness」とは何か → 原文の段落

役割:complexity_not_quality / 語り手:解説本文

$$
\boxed{\text{Complexity of Harness}\neq\text{Quality}}
$$
固定した根拠の識別情報
記事の版
rev_f242ed66-42d3-401c-8511-3cf2afb7e533
段落
blk_96ad4a08-600f-4b51-bb71-202f9ff942f7
本文パッケージ SHA-256
438dedb4b52a2764a892419d6c13912814764d4e3342f1c176ffb05f854a0247
段落 SHA-256
545d7c5d4e9ede8be0f3eab14c63219a0871404aea81a02094b5e5838b1b4f76

3. Metaは「広告企業」から「パーソナルAI OS企業」へ変わるのか → 原文の段落

役割:system_contribution_axes / 語り手:解説本文

$$
\text{Agent Performance}=f(\text{Model},\text{Harness},\text{Memory},\text{Environment},\text{Tools},\text{Compute})
$$
固定した根拠の識別情報
記事の版
rev_2608eadb-b168-4acc-988e-7bb80c12e3ad
段落
blk_61b1dd10-635b-4b75-b739-a56235959c80
本文パッケージ SHA-256
973a5ff12034ff15d6d7fe2f221e3376914729befa0e55d68bbe1de0236f5538
段落 SHA-256
a1bf1155138a82247b7ea05409ae75952ff5777cfe9ac7e80c2b79a29f04fb09

4. AI Agentの「Harness」とは何か → 原文の段落

役割:held_out_evaluation / 語り手:解説本文

そして変更したHarnessを、探索中には見せていない**Held-out Test**で評価します。
固定した根拠の識別情報
記事の版
rev_f242ed66-42d3-401c-8511-3cf2afb7e533
段落
blk_691669d8-0563-4492-a5b4-f77da9fc7710
本文パッケージ SHA-256
438dedb4b52a2764a892419d6c13912814764d4e3342f1c176ffb05f854a0247
段落 SHA-256
3aade5771f75e99030ccbf268d00dfba313979191c809a59338b3597d594047d
編集候補の確認状態・暫定評価を読む

以下はAIによる編集上の確認です。著者承認、方法の正しさ、独創性、回答品質の点数ではありません。合計や価値順位は付けていません。

確認軸暫定値確認理由
手順の具体性2 / 2必要入力・比較手順・反証条件・不足時の対応を明記した編集候補。
根拠との直接性2 / 2公開対象の固定版・根拠段落から、元記事にある区別と条件を追跡できる。転用部分は編集推論として区別する。
転用例の確認未確認他の対象への転用効果と回答品質は未測定。実用性の点数を意味しない。
定義の由来
記事から推論した分析候補
編集
AIによる候補整理・著者未承認
回答品質の比較試験
未実施
編集記録日時
2026-10-01T01:20:46+09:00
定義の版
rprev_49fddb56-4525-5525-9af6-9f23f7e48863

この見方を使って質問する

対象・質問・情報の基準日を任意で加え、定義、使える条件、限界、引用を含む文章を取得できます。入力した内容を使って、この画面でAIに質問する処理は行いません。

Promptに追加する任意の入力

どの日までの情報で考えるかを指定します。元記事の公開日とは別です。空欄は未指定として残します。

入力なしの定義・根拠を保存

入力機能を準備しています。定義・根拠は保存リンクから取得できます。