Pythonを書かずに
トレーディングのための機械学習。
ビジュアル宣言型パイプライン:ドラッグ、接続、設定。特徴量エンジニアリング、時間的クロスバリデーション、ハイパーパラメータチューニング、デプロイ — すべて同じアプリ内で、すべてコンポーザブル。
Verida ML — visual declarative DAG, from raw data to materialized prediction
パイプラインフロー
生データからライブインジケーターとしてのマテリアライズド予測まで。
モデルバックエンド
組み込みまたはカスタム。フレームワークはアルゴリズムアグノスティック。
Gradient Boosting
gbdt アンサンブルの決定木。ロバスト、非線形性を処理。scikit-learn経由。
MLP
mlp 多層ニューラルネットワーク。PyTorch経由。複雑なパターンに柔軟。
Random Forest
random_forest 独立した木のアンサンブル。分散を低減、オーバーフィッティングに耐性。
Centroid
centroide セントロイド距離分類器。シンプル、解釈可能、外部依存なし。
KNN
knn K-Nearest Neighbors。特徴量空間の近接による分類。
K-Means
kmeans 教師なしクラスタリング。ラベルなしでパターンをグループ化、レジームに有用。
Isolation Forest
isolation_forest 異常検出。事前ラベル付けなしで外れ値を特定。
Linear
linear 線形回帰/分類。解釈可能なベースライン、高速訓練。
+ インラインPythonスクリプトでカスタムバックエンド — treinar/inferirを定義して任意のライブラリを使用。
DAGコンポーネント
各ノードは変換。好きなようにコンポーザブル。
特徴量エンジニアリング
ラグ、変換(log、sqrt、return_pct)、相互作用(ratio、product、difference)。
カレンダー特徴量
時間、曜日、周期性の正弦エンコーディング。
インピュテーション
NaN埋め(mean、median、zero、ffill、bfill)。因果的、先読みなし。
外れ値除去
経験的クオンタイルによるクリッピング。分布を歪めずに極値を除去。
分散閾値
ゼロ分散の特徴量を破棄。情報を追加しない列を排除。
相関フィルター
ターゲットとの相関でtop-k特徴量を保持。マルチコリネアリティを低減。
クロスバリデーション
時間的k-fold、walk-forward(expandingまたはrolling)、embargo付き。
ハイパーパラメータチューニング
グリッドサーチまたはランダムサーチ、ランキングメトリック評価付き。
ラベリング
方向(+1/0/-1)、連続リターン、またはカテゴリカル組み合わせとしてのラベル。
MLはオラクルではない
パイプラインは履歴データで最適化。直感より良い?たぶん。手動オーバーフィッティングより良い?確実に。未来を予測?いいえ。市場は不可知。
MLがすること:過去にパターンを見つける。あなたがすること:そのパターンが重要か判断する。