# メモ:トークン資本主義とLLM前処理アーキテクチャ
## 1. コア概念:トークン資本主義 (Token Capitalism)
AI時代において、「計算資源」とそれを計量した「トークン」は次世代の重要な資本である。
システムやアプリケーションの競争力は、有限のトークンをいかに効率よく配分・燃焼させるか(トークン効率)にかかっている。
## 2. ROIの定義と最大化の原則
* **ROI = 生成結果(出力価値) / プロンプト(消費トークン + 人間の入力労力)**
* 出力品質が一定の要件を満たすなら、分母であるプロンプト(入力トークン)を極限まで圧縮することでROIが最大化する。
## 3. 解決策:「前処理(Pre-processing)」の導入
人間(自然言語のプロンプト)とLLMの間に「トークン効率を最大化する変換器」を挟む。
LLMにはパース(解析)をさせず、推論(Reasoning)に資本(トークン)を集中させる。
### 効果的な3つの前処理アプローチ
1. **エッジ処理による「状態」の抽出:**
生データ(音声、センサー、入力特性など)をそのままLLMに送らず、エッジ側で軽量に処理。純度の高い「状態(State)」のみをフラグ化(JSON等)して送信する。
2. **決定論的プログラムによるエンティティ抽出:**
日時や金額などの特定情報の抽出はLLMで行わず、事前にPython等のスクリプト(正規表現など)で処理。事実を確定させてから構造化データとしてLLMに渡す。
3. **セマンティック・ルーティング:**
タスクの難易度に応じて処理経路を最適化する。
* キャッシュ(過去の類似タスク):トークン消費ゼロ
* 軽量モデル(単純分類・定型処理):コスト極小
* 大規模モデル(高度な推論・複雑なタスク):資本を集中
## 4. 理想的なデータパイプライン
1. **軽量化**: 入力データからノイズや不要な修飾をプログラム的に削除。
2. **抽出**: 決定論的処理で必要なエンティティをJSON等に構造化。
3. **ルーティング**: 意図に応じてキャッシュ・軽量LLM・大規模LLMへ振り分け。
4. **高密度プロンプト生成**: 「最小限の指示」+「構造化済みの抽出データ」を結合し、極限まで圧縮された状態で最終的なLLMへ送信する。
| レイヤー | 担当技術 | 処理内容の例 |
| 第1層 (確定抽出) | Pythonスクリプト等 | OCR読み取り結果からの特定パターンの抽出や、日時抽出モジュールなどによる事実データの確定。 |
| 第2層 (圧縮・分類) | ローカルLLM (Edge AI) | キーボードやセンサーの入力特性からユーザーの「状態」を推定しフラグ化する。または自然言語の揺らぎをJSONに変換する。 |
| 第3層 (高度な推論) | クラウドLLM (Ultra級) | エッジから送られてきた「極限まで圧縮・構造化されたデータ」を元に、複雑な分析やコード生成を行う。 |