公開:2026年9月11日, 最終更新:2026年9月11日
30秒サマリー
- 実環境で稼働するLLM取引エージェント2フリートを6カ月追跡した大規模実証研究がarXivで公開された
- エージェントの勝率は41%にとどまりリテール投資家の50%を下回り、方向性のある優位性は確認されなかった
- 損益悪化の主因は「ボラティリティを無視したレバレッジ設定」と「利益確定の失敗」であることが定量的に示された
何が起きたか
バートン氏ら7名の研究者は2026年9月、LLM自律取引エージェントの実運用データを分析した論文をarXivに投稿した。対象は2つのシステム——2026年2〜3月に稼働した「DX Terminal Pro」(3,505ユーザーが資金を預けたボールト、実際のETHをBaseのミームコイン市場で21日間取引)と、同年6〜8月に稼働した「DXAPライブアルファフリート」(ユーザー作成エージェント500〜599件、うち同時稼働91〜117件、Hyperliquid上の永久先物を取引)。期間中に単一モデルの呼び出しは約750万回、オンチェーンアクションは約30万回、マルチツールターンは231,638回に達し、14,596件の約定を記録した。
論文が提示する主要知見は4点ある。第1に、エージェントの実際の行動を最も強く規定するのは「戦略テキスト」ではなく「動作レイヤー(リスクスライダー等のUI設計)」であり、エージェント固有の固定効果が行動分散の60%を説明する。リーダーボードの上位3枠という表示境界が選択を因果的に誘導していることも回帰不連続分析で確認された(境界前後で1.75倍)。第2に、レバレッジ設定がボラティリティに無感応であり、ボラティリティの高低を問わず中央値レバレッジは5.0倍で固定されており、ポジションサイズの11%を占める特定セルが清算全体の62%を占める。
第3に、エージェントは含み益をほぼ取り込めていない。ポジションの43.2%が24時間以内に300ベーシスポイント以上の有利な方向への動きを経験したにもかかわらず、そのうち49.3%はマイナスのリターンで決済されていた。機械的なブラケット注文を適用すれば1ポジション当たり+39.0ベーシスポイントの改善が見込まれると論文は試算する。第4に、両フリートともに方向性のある優位性は確認されず、DXAPフリートのラウンドトリップ勝率は41%で、マッチドサンプルによるHyperliquidのリテールベンチマーク(50%)を下回る。416の実運用シナリオを用いたフロンティアモデル間の再現比較では、意思決定の質は統計的に区別不可能だった一方、モデルファミリーによって選択の安定性に大きな差が見られた。なお、論文末尾には著者ら自身の過去の撤回経験から蒸留した17のメソドロジー規範が付記されている。
原典ハイライト
DXAP フリートのラウンドトリップ勝率は41%で、マッチドリテールベンチマークの50%を下回る。含み益300bps超を経験したポジションの49.3%がマイナスリターンで決済されており、機械的ブラケットだけで+39.0bps/ポジションの改善余地がある。レバレッジ中央値はボラティリティ全6分位で一貫して5.0倍であり、ボラティリティ感応性がゼロであることが示された。
出典: arXiv cs.AI(論文)
So What?(なぜ重要か)
編集部の見解として——LLMエージェントの取引能力への楽観論に対し、実運用スケールの反証データが初めて系統的に示された点が重要だ。「戦略プロンプトより動作レイヤー設計が行動を決定する」という知見は、AIエージェントを業務に組み込む際のガバナンス設計の優先順位を根本的に問い直す。リスク管理のロジックをエージェント外部の仕組みとして実装しなければ、高度なモデルを使っても収益改善につながらない可能性を示唆している。
日本企業への示唆
日本企業がAIエージェントを自律的な業務執行(発注・契約・資源配分など)に導入する際、以下の点を検討すべきだと編集部は考える。①プロンプト設計よりUIや動作レイヤーの設計がエージェント行動を左右するため、ガバナンス上の統制ポイントはプロンプト管理ではなくシステム設計側に置く必要がある。②ボラティリティ(外部環境の変化)に対してエージェントが自動的に感応しない可能性があるため、リスク上限は外部ルールとして機械的に実装する。③エージェントが「好機を掴めずに損失で終わる」傾向は取引以外のドメイン(交渉・調達等)でも起こりうる構造的問題として意識すべきだ。④複数のフロンティアモデル間で意思決定品質が統計的に区別できないという知見は、モデル選定より運用設計に投資すべき根拠となりうる。
背景・経緯
本論文はarXivのcs.AI・cs.CE・cs.MAに分類される学術論文として2026年9月4日に投稿された。対象となった2システムはいずれも同一の設計系譜を持つとされており、2026年2月から8月にかけて実運用された。著者らは過去の自らの撤回経験から17のメソドロジー規範を策定しており、再現性と因果推論の堅牢性に配慮した設計(日次クラスター推論・置換ヌル・共通手数料再計算)を採用している。原文ではどの企業・組織が両システムを運営していたかについては言及がない。



