SYSTEMS · July 16, 2026 · 8 MIN READ

CuteDSL、潜在テレポーテーション、そして高速生成への最短経路

すべての中間表現を再構築するコストを支払わずに、生成パイプラインで作業を進めるための実用的なメンタルモデル。

生成ワークロードは、モデルがシステム全体であるかのように説明されることが多い。実際には、遅い部分はモデルの周りの移動であることが多い:重みのロード、フォーマット変換、テンソルのコピー、ワーカーの待機、そして別のステージが再利用できたはずの中間表現を捨てること。

CuteDSLは、その境界を考えるのに役立つ方法。作業の小さな宣言的な記述は、高価な表現がアクセラレータの近くに留まる間、システム内を移動できる。目標は巧妙な構文ではなく、オーケストレーションを安価に保ち、推論をビジーに保つこと。

「潜在テレポーテーション」が指し示すもの

このフレーズをメンタルモデルとして使ってください。毎回ピクセルやテキストから問題全体を再構築する代わりに、互換性のあるステージ間でコンパクトな潜在表現や既に有用な中間表現を移動させます。リサイズ、スタイルパス、時間パス、アップスケールがその表現を直接消費できるなら、パイプラインは不要なデコード・エンコードループを回避できます。

実践的なテスト

「次のステージが必要な情報を失わずに受け入れられる最小の表現は何か?」と自問してください。その答えは、JSONリクエストから数ミリ秒を削るよりも、通常はより良い最適化ターゲットです。

節約効果が現れる3つの場所

1. ホットパスを常駐させる

ワーカーをウォームアップし、読み込んだ重みを再利用します。キューが次に何を実行するかを決定し、実行環境を繰り返し再構築しないようにします。

2. 互換性のある作業をバッチ処理する

同じ形状、モデル、精度の画像はセットアップを共有できます。バッチ処理は、スケジューラーがバッチを形成するのに十分な作業を十分早く認識した場合に最も有用です。

3. 適切な境界をキャッシュする

決定論的な前処理と再利用可能なコンディショニングをキャッシュします。コンパクトな中間表現が複数の下流コンシューマーに役立つ場合、巨大な最終成果物をキャッシュしないでください。

コンパクトなパイプラインのスケッチ

request -> normalize prompt + references
        -> choose model / shape / precision
        -> warm worker or form a compatible batch
        -> generate in latent space
        -> decode only at the delivery boundary
        -> durable result + usage record

重要な境界は最後のものです。人間や外部APIがピクセルやフレームを必要とするときにデコードします。内部ステージが決定を下したいとき毎回ではありません。

パス全体を測定する

キュー待ち、ワーカー起動、モデル読み込み、推論、デコード、アップロード、最初のプレビューまでの時間を個別に追跡します。より高速なカーネルも良いですが、10秒の起動を排除するウォームワーカーはしばしば大きな勝利です。最も遅い可視セグメントを最適化し、実際のプロンプトと実際の出力形状で再度測定します。

Try these prompts on your own shot.

Every example on this page was generated with ManifoldGen. Open the Studio and run the same structure on your idea.

Open Studio