数か月ごとに、新しい波のAI取引ツールがやってきて、価格がどこへ向かうかを教えると約束する。売り文句はいつも、同じ文のどれかのバリエーションだ。モデルは、人間にはできないパターンを見つけるのだと。
その文の正直な版は、ずっと小さく、そしてはるかに役に立つ。機械学習には、暗号市場での実際の仕事がある。ただし、通常は売り込まれている仕事ではない。ここが、その線が実際にどこに引かれている場所であり、遭遇したあらゆるAIの主張をどう検証するかを示す。
なぜ「方向」は予測するのが最も難しいのか。最も簡単だからではない。
流動性のある市場は、じっと座って解かれるのを待つパズルではありません。すでに、あなたのモデルがたまたま気づいたことを値付け済みの群衆です。
公開データに方向性のパターンが見えるころには、それは同じデータと接続を持つ誰にでも見えてしまっています。その環境では、最大級のペアほど、個人向けツールが持つ以上の速いインフラと資本を持つ企業も含まれます。そこで次の一手の方向性を予測するのは、すでに誰かが投げたコインを言い当てるのに近い。
これは、より大きなモデルにすれば解消される制限ではありません。問題の構造です。価格がどちらに動くかを教えてくれる情報は、まさに“深い市場”が最速で奪い取ってしまう情報なのです。
だから、AIツールが価格目標を前面に出してきても、それは高度さの証拠ではありません。買いたいと思う人が求める“その商品”を売っている証拠です。
機械学習が本当にうまく予測できるのは何か
4つのこと。どれもチャート上の“矢印”ではありません。
どれくらいか、という“量”。方向性ではなく。“ボラティリティ”にはリターンと違って性質があります。それは持続することです。穏やかな日々は穏やかな日々と固まり、激しい日々は激しい日々と固まり、そして今日のショックは明日の大きな値動きの確率を高めます。この“大きさ”の自己相関は学習に十分安定しています。中心が本当に未知であっても、起こり得る結果がどれくらい広い範囲かをモデルは示せます。そして、その単一の推定が、ポジションサイズ、ストップ配置、そして今日が昨日よりも慎重であるべきかどうかを左右します。
どんなレジームにいるか。トレンド型かレンジ型か、流動性が拡大しているか縮小しているか、ポジションが混雑しているか薄いか。レジーム分類は、観測可能な入力を使った普通の教師あり問題で、他のどんな推定にどれだけの信頼を置くべきかを左右します。
フローの分類。これは取引の“運用上の配管”ですか、それとも“経済的な意図”ですか? 大口の新規鋳造需要ですか、あるいは国庫のスケジュールですか? オーダーブックの厚みは実際のものですか、それとも層を重ねた見せかけですか? これらは解ける問題で、現実の特徴量があります。そして、あまりにも無骨なので、宣伝する人はほとんどいません。
執行。オーダーをどう分割すれば、板が薄いときに価格があまり動かないか。いま在庫を持っているのはどの会場か。ここで機械学習は静かに、着実に稼ぎます。予測っぽく聞こえないから、プロモーションスレッドには決して登場しません。
パターンを見てください。あのリストのすべては、未来を言い当てることではなく、現在を正確に測ることについてです。市場におけるAIの正直な居場所はそこです。
ほとんどのAI取引システムを台無しにする計測トラップ
仮に何かを作ってバックテストがきれいに当たったとしましょう。次に、私たちが目にする頻度の順に、そこでだいたい何が間違っているのかを挙げます。
重なり合うウィンドウはサンプルを膨らませます。日次データで30日リターンを測るなら、連続するウィンドウは30日のうち29日を共有しています。3,000件のローリング観測が、真に独立したものはだいたい100件程度から来ていることもあります。信頼区間は最初の数字ではなく2つ目の数字に比例してスケールします。そして、最初の数字を報告するのが、“自分が稼いだわけではない確実さ”を作り出す一番簡単な方法です。
Lookahead leaks in quietly. Any step in your pipeline that uses information not available at decision time - a normalisation computed over the whole dataset, a filter that selects periods based on what happened inside them - produces a beautiful and worthless result. This rarely happens on purpose. It happens in a preprocessing line nobody re-read.
サバイバーシップバイアスは、あなたが見る前にデータを形作ります。上場は来たり去ったりします。現在上場しているペアから組んだ履歴は、静かに“失敗したもの”をすべて除外します。モデルは、何も死ななかった世界から学習しているのです。
レジームドリフトはエラーメッセージなしでモデルを壊します。これは私たちが直接支払うことになったので、数字は私たちのものです。私たちは資産の実現履歴から予測レンジを構築しました。主要な8つのコインについて、過去20,058件の履歴観測で検証したところ、条件なしの手法は目標50%に対して結果の55.6%をカバーしました。つまり、やや緩い程度でした。ところが市場環境ごとにテストを分けると、最も落ち着いた5分位の期間では67.1%でした。そのレンジには乱気流への恒久的な余裕を持たせており、静かな市場ではその余裕は“稼いでいない”ものでした。サンプルを現在のボラティリティで条件付けすると、それは50.8%まで戻りました。
その失敗は日々の運用からは見えませんでした。結果はずっと範囲の中に着地していました。ポイントはここです。寛容すぎるモデルは、静かな成功が絶えず続き、まったく症状が出ないのです。
あらゆるAI取引の主張を5つの質問で評価する方法
遭遇するあらゆるツール、サービス、スレッドで使えます。
大きさを予測しますか、それとも方向性を予測しますか? 大きさの主張は擁護可能です。流動性のあるペアでの方向性の主張には、モデルがどう説明されていようと強い懐疑を向けるべきです。
その主張は、結果が出る前に記録されましたか? 後から撮ったスクリーンショットは証拠ではありません。結果をすでに知っている人が組み立てたパフォーマンス曲線も証拠ではありません。事前に固定された主張だけが確認できます。
どんな指標が報告されていて、両方向で失敗し得ますか? 希少イベントの精度は意味がありません。そもそも発火しないモデルは、素晴らしいスコアを出します。レンジ予測なら、カバレッジを求めてください。それは狭すぎることにも広すぎることにも“引っかけて”くれます。
独立したサンプルサイズはどれくらいですか? 行数ではありません。真に独立した観測の数です。誰も答えられないなら、そのバックテストはそもそも精査されていません。
失敗は公開されていますか? 成功だけが載った実績が、意図していようといまいと“フィルタ”されています。見えている取りこぼしがないこと自体が、発見です。
この5つの質問をすり抜けるツールなら、あなたの時間をかける価値があります。ほとんどは2つ目の時点で生き残れません。
特に疑うべきポイントは何か
言い方はともかく“保証されたリターン”。サンプル数や期間が明示されない精度のパーセンテージ。ウォークフォワードテストのないバックテスト。「仕組みはプロプライエタリ」と回答すること。さらに、特に最大級のペアでは自信満々に価格目標を提示するのに、その自信の根拠は最も薄い。
これらのどれも悪意の証明ではありません。多くは率直な人で、そもそも2つ目の質問を投げられたことがないだけです。
この“デフレ”は、この種のものなら最後に置くべき話です。
流動性のある市場を確実に上回る方法はありません。そして、それを約束する人は何かを売っています。たいていはサブスクリプション、時にはトークン、そして常にスクリーンショットです。
暗号領域で機械学習が提供できるのは“先読み”ではありません。より良いのは現在の計測です。つまり、この市場がどれだけ動けるか、今どんな状態か、あなたの実行コストはいくらか、そしてそれらの数値がどれほど不確かなのか。これらは、一般にそのカテゴリーが売り込む主張よりも小さい。ですが、検証に耐え、1年後もなお真実であるという利点があります。
ここで1つの習慣を持ち帰るならこうです。価格の周りに確率ゾーンが描かれているのを見たら、その中に結果がどれくらいの頻度で着地しているか数えてください。50%だと主張するゾーンがほとんど全部を拾うなら、それは正確ではありません。曖昧です。そして、曖昧さこそが“内部から見た精度”です。
教育目的のコンテンツ。金融助言ではありません。
