Premium

Pythonを書かずに
トレーディングのための機械学習。

ビジュアル宣言型パイプライン:ドラッグ、接続、設定。特徴量エンジニアリング、時間的クロスバリデーション、ハイパーパラメータチューニング、デプロイ — すべて同じアプリ内で、すべてコンポーザブル。

Verida ML pipeline: visual declarative DAG with feature engineering, training and validation

Verida ML — visual declarative DAG, from raw data to materialized prediction

パイプラインフロー

生データからライブインジケーターとしてのマテリアライズド予測まで。

1
rawシリーズ(OHLCV)
2
特徴量エンジニアリング(ラグ、変換、カレンダー)
3
インピュテーション + 外れ値除去 + 分散閾値
4
相関フィルター
5
分割(walk-forward、時間的)
6
訓練(gbdt、mlp、random forest、centroid、knn、またはカスタム)
7
検証(accuracy、F1、混同行列、バックテスト)
8
インジケーターとしてマテリアライズド予測(ct://derived/...)

モデルバックエンド

組み込みまたはカスタム。フレームワークはアルゴリズムアグノスティック。

Gradient Boosting

gbdt

アンサンブルの決定木。ロバスト、非線形性を処理。scikit-learn経由。

MLP

mlp

多層ニューラルネットワーク。PyTorch経由。複雑なパターンに柔軟。

Random Forest

random_forest

独立した木のアンサンブル。分散を低減、オーバーフィッティングに耐性。

Centroid

centroide

セントロイド距離分類器。シンプル、解釈可能、外部依存なし。

KNN

knn

K-Nearest Neighbors。特徴量空間の近接による分類。

K-Means

kmeans

教師なしクラスタリング。ラベルなしでパターンをグループ化、レジームに有用。

Isolation Forest

isolation_forest

異常検出。事前ラベル付けなしで外れ値を特定。

Linear

linear

線形回帰/分類。解釈可能なベースライン、高速訓練。

+ インラインPythonスクリプトでカスタムバックエンド — treinar/inferirを定義して任意のライブラリを使用。

DAGコンポーネント

各ノードは変換。好きなようにコンポーザブル。

特徴量エンジニアリング

ラグ、変換(log、sqrt、return_pct)、相互作用(ratio、product、difference)。

カレンダー特徴量

時間、曜日、周期性の正弦エンコーディング。

インピュテーション

NaN埋め(mean、median、zero、ffill、bfill)。因果的、先読みなし。

外れ値除去

経験的クオンタイルによるクリッピング。分布を歪めずに極値を除去。

分散閾値

ゼロ分散の特徴量を破棄。情報を追加しない列を排除。

相関フィルター

ターゲットとの相関でtop-k特徴量を保持。マルチコリネアリティを低減。

クロスバリデーション

時間的k-fold、walk-forward(expandingまたはrolling)、embargo付き。

ハイパーパラメータチューニング

グリッドサーチまたはランダムサーチ、ランキングメトリック評価付き。

ラベリング

方向(+1/0/-1)、連続リターン、またはカテゴリカル組み合わせとしてのラベル。

MLはオラクルではない

パイプラインは履歴データで最適化。直感より良い?たぶん。手動オーバーフィッティングより良い?確実に。未来を予測?いいえ。市場は不可知。

MLがすること:過去にパターンを見つける。あなたがすること:そのパターンが重要か判断する。