# 分離スキルベンチマーク

[本文と実行状態の左右比較](comparison.html)

同じユーザー入力でtanteki一式の導入効果を比較する。生成中にスキルが行った検査・改稿は含む。採点のtextlint結果は生成へ返さない。未発火も集計に残し、品質は両側が有効なペアで評価する。取得・コマンドの観測はログからの推定であり、スキルの遵守や全ファイルアクセスの証明ではない。失敗時にプロバイダーが利用量を返さなかった呼び出しのトークン数は不明。

状態: 採点済み。有効ペア 4/4、採点済みペア 4。

| 指標 | スキルなし | スキルあり |
|---|---:|---:|
| 計画した実行 | 4 | 4 |
| 環境検証済み | 4 | 4 |
| 環境無効 | 0 | 0 |
| 実行失敗 | 0 | 0 |
| 本文取得をログで観測 | 0 | 4 |
| lintコマンドをログで観測 | 0 | 2 |
| 採点対象 | 4 | 4 |
| 採点用lint合格 | 0 | 4 |
| モデル呼び出し（失敗含む） | 4 | 24 |
| 入力トークン（報告された全実行分） | 23708 | 344185 |
| 出力トークン（報告された全実行分） | 5744 | 12600 |
| 意味基準合格 | 8/20 | 17/20 |

品質の差はケースと反復ごとのペアで読む。モデル出力の決定性や一般的な優位は保証しない。
