Auriko
LLM プロバイダーを取引会場として扱い、平均で約 30% の推論コストを節約するゼロマークアップ推論ルーティングおよびコスト最適化プラットフォーム
詳細レポート
-
Auriko は自らを「AI 推論のトレーディング デスク」と位置付けており、これは本質的に大規模モデル推論のためのインテリジェントなルーティングとコスト最適化レイヤーです。 OpenAI と互換性のある単一の API を使用して、OpenAI、Anthropic、Google、xAI、DeepSeek などの 10 社以上のサプライヤーを接続し、コスト、レイテンシー、スループット、その他の目標に基づいて、各リクエストを現在の最適なサプライヤーとモデルの組み合わせにルーティングします。公式の測定結果によると、推論コストを平均して約 30% 節約できるとのことです。その中心的なセールスポイントは、キャッシュを意識したアービトラージとマークアップを使用しない自動フェイルオーバーです。
-
Auriko は元定量トレーダーのマイケル・ヤンによって設立されました。彼は Product Hunt の AMA でそれを非常に簡単に述べました。彼が初期のオプション取引から発症した「最安値を見つける」という強迫性障害は、サプライヤー間で頻繁にモデルを切り替える必要があった AI エージェントの構築時に再燃しました。結局、彼は推論コストを比較するためのシステムを構築しただけでした。チームはLLMサプライヤーを「取引会場」と見なし、定量的裁定取引の方法論をコスト最適化の推論に適用します。この製品は発売後、Product Hunt のデイリー リストでトップとなり、現在のページ評価は 4.7 (3 件のレビューに基づく) でした。しかし、本当に貴重なシグナルは、創業者の数十の質問と回答から得られました。多数の上級エンジニアが、キャッシュの固定性、品質のドリフト、フェイルオーバーの請求などの問題について詳細な質問を実施しました。
-
Auriko の核心は、統合された API ゲートウェイです。ユーザーは既存の OpenAI クライアントを api.auriko.ai/v1 に指定するだけで、アプリケーション コードを書き換えることなく複数のベンダーのモデルを呼び出すことができ、各ベンダーの固有の機能 (Anthropic のキャッシュ_コントロール、OpenAI のプロンプト_キャッシュ_キーなど) を保持できます。 徹底したコストの最適化が特徴です。入出力トークンの「価格」を比較するだけでなく、ユーザーのワークロードと各サプライヤーの価格設定およびプロンプト キャッシュ メカニズムとの相互作用をモデル化し、各リクエストを実効コストが最も低いサプライヤーにルーティングします。ヒント キャッシュの最適化は自動的に実行されます。プロバイダーがそれをサポートしている場合、重複するコンテキスト フラグメントがキャッシュから直接ヒットされ、冗長なトークン コストが節約されます。 ルーティング ポリシーは、コスト優先度、遅延 (TTFT) 優先度、スループット優先度などの組み込みのデフォルトをサポートします。また、最初のトークンの最大遅延、1 秒あたりの最小トークン スループット、ZDR (ゼロ データ保持) サプライヤーのみ、構造化された出力、自動ダウングレードなど、カスタマイズされた目標と厳しい制約も可能です。予測シグナル ダッシュボードは、サプライヤーのパフォーマンス、健全性、キャッシュ動作、使用特性に関するリアルタイムの定量的なデータを提供します。これにより、ルーティングの決定が促進されるだけでなく、ユーザーが「特定のリクエストが特定のサプライヤーに送信された理由」を監査することもできます。 また、自動フェイルオーバー (冗長性とフォールバックを備えたすべてのリクエスト)、グローバル エッジ デプロイメント、ハイブリッド BYOK (Bring Your Own Key) とプラットフォーム管理のキー オーケストレーション、キャパシティ インテリジェンス (グローバル キャパシティ リザーブはオンデマンドで拡張)、ワークスペース/API キー レベルでの予算上限とアラートもあります。エコロジカルな統合には、OpenAI Agents SDK、Claude Agent SDK、Google ADK、LangChain、Vercel AI SDK、LlamaIndex、CrewAI、Claude Code、Hermes、OpenCode などが含まれており、数分でアクセスできるとされています。
-
Auriko の公式声明は「価格値上げゼロ」です。BYOK 経由でアクセスする場合、ユーザーはサプライヤーに直接価格を支払い、Auriko は価格差額を追加しません。コストの最適化は、プラットフォーム手数料ではなく、完全にルート裁定取引によって実現されます。現在、プラットフォーム キーの具体的な請求基準に関する公開情報はほとんどなく、値上げゼロの提案は主に自分のキーを持ち込むシナリオを対象としています。コストを重視し、頻繁にコールするチームにとって、この「節約するだけで差額は得られない」構造は非常に魅力的です。
-
プラスの材料は、リアルマネー紙幣の減少に集中している。 Product Hunt の多くのユーザーは、「毎月の API 請求が直接 3 分の 1 削減された」と報告し、「定量的なチームによって作成されており、最適化ロジックは信頼でき、データは嘘をつきません」と述べています。 LLMサプライヤーを取引の場として利用し、価格差裁定を行う仕組みも、「これまでにないが、説明すれば納得できる」賢いポジショニングであると評価された。 質問は非常に専門的で、実際の実務家からのものです。一部のユーザーは、安価なパスにルーティングすると品質が犠牲になるのではないかと心配しています。創設者は、モデルカタログは実際のアイデンティティ識別を使用し、特定のモデルと定量化されたバージョンを指定でき、ルーティングは「同じモデル」内の最適なサプライヤー/パスのみを選択し、オンラインになる前にモデルの品質を評価すると答えました。もう 1 つの深刻な問題は、キャッシュのスティッキー性です。リクエストごとの利益を追求すると、セッションが異なるプロバイダー間でジャンプする可能性があり、キャッシュは決してウォームアップされません。創設者は、ルーティング エンジンがキャッシュ ステータスを独立した信号として扱い、各リクエスト (セッションの途中を含む) ごとに再評価することを確認しました。キャッシュはコールドであり、それに応じて予想コストも変化します。また、フェイルオーバーの再試行オーバーヘッドが 30% に含まれるかどうかという質問もありました。答えは、「安くてもジッターが発生しやすいパスは安くない」ということです。実際のテストには再試行とエラー報告が含まれており、ロールバック チェーンは透過的に確認できます。
-
業界ナビゲーション サイト (aipure、aitoolly、aitoolnet、mossai、neurokitai など) は一般に、Auriko を「エンタープライズ レベルの AI 推論最適化プラットフォーム」として分類し、その統合 API、キャッシュ対応ルーティング、ゼロ マークアップを強調しています。 sulat.com のサプライヤー プロフィールによると、Auriko は現在、DeepSeek V4、Kimi K2.6、Grok 4.3、Claude Opus 4.7、GLM-5.1、Qwen3.6 などをカバーする約 15 のモデルを公開しており、それぞれのコンテキスト ウィンドウと単価がマークされています。ほとんどのレビューは、その予測シグナルと予算管理が実用的なハイライトであると信じていますが、初期構成と統合は専門的であり、初心者にとっては一定の敷居があるとも指摘しています。
-
最も憂慮すべきことは、「同じモデル、異なるサプライヤー」の品質の変動です。たとえ公称価格が同じであっても、異なるサプライヤーによって実行される同じモデルには、量的な違い、遅延イメージ、および微妙な出力の違いが存在する可能性があります。最も安価なノードにルーティングすると、顧客サービスの外部シナリオの動作が予測不能になる可能性があります。 Auriko はこの問題を軽減するために「実際のモデルのアイデンティティ + ユーザーの明示的な仕様 + 起動前評価」を使用しますが、これにはユーザーがモデルと制約を完全に放棄するのではなく、モデルと制約自体を明確に定義する必要があります。 2 つ目は、データの品質と信頼コストです。コスト削減の 30% は、公式独自のベンチマーク (2026 年 5 月 28 日から 06 月 7 日までの期間、80,634 リクエスト、22,416 セッション) によるものです。堅牢性はマッチング ペア、階層ブートストラップ、ウィルコクソン テストなどによってパッケージ化されていますが、サンプルと期間はメーカーによって支配されており、水平方向の複製スペースは限られています。ゼロ データ保持 (ZDR) は利点ですが、ルーティング層にはメタデータとキャッシュ動作が表示されるため、強力なコンプライアンス シナリオを自分で評価する必要があります。
-
これは、特にコーディング エージェント、カスタマー サービス ロボット、コンテンツ生成、およびコンテキストが多く繰り返されるその他のワークロードを実行する場合に、複数のモデルと複数のサプライヤーの間で切り替えを行う高頻度でコスト重視の AI エンジニアリング チームに最適です。ここでは、キャッシュを意識したルーティングが最大のメリットをもたらします。これを「接続して無視」できるブラック ボックスとして扱うことはお勧めできません。外部の顧客シナリオでは、モデルと品質の制約を明示的に設定し、さまざまなワークフローの API キーを分離して、キャリブレーション エンジンがトラフィック プロファイルを個別に学習して、より明確にコストを削減できるようにする必要があります。チームが 1 つのモデルのみを使用し、呼び出しの数が少ない場合、ルーティング層の導入が複雑になるため、コスト効率が良くない可能性があります。代替案には、LiteLLM や OpenRouter などのゲートウェイ層での直接ルーティング、または自社開発のマルチベンダー スケジューリングが含まれます。
-
Auriko は、定量的裁定取引のアイデアを使用して、「推論コストの削減」を形而上学から測定可能で監査可能な工学的な問題に変換します。ゼロマークアップとキャッシュを意識したルーティングは実際の違いです。ただし、品質と一貫性に対するより多くの責任がユーザーの明示的な制約に返されるため、完全に自動化されたホスティングを望むチームではなく、構成としてルーティング戦略を慎重に調整したいエンジニアリング チームに適しています。
ユーザーレビュー
-
NathanRuizIII—私が最も心配しているのは品質のドリフトです。同じモデルでもサプライヤーが異なれば、定量化も異なる可能性があります。 Auriko のモデル ディレクトリは実際の ID 識別を使用しており、定量化されたバージョンを指定することもできます。ルーティングは同じモデル内のパスのみを選択するため、ほとんどの地雷原が排除されると言えます。ただし、外部顧客の場合は、厳しい制約を設定し、完全に諦めないことをお勧めします。 -
James_Nelson0078—30%は公式が自ら計測したものなので、まずは半分を信じてください。 -
brJAM—複数のサプライヤー間を行き来するエージェントチームとして、この「トレーディングデスク」のフレームワークは私にとって非常に適しています。トークンの価格は、サプライヤー間で最大 4 倍異なる場合があります。 Auriko は定量的手法を使用して、この価格差に対する自動ルーティングを作成します。実際に月々の請求額が 30% 近く削減されたことが測定されましたが、その前提として、リクエスト パターンが十分に安定しており、キャッシュをウォームアップできることが必要です。寒い時期のスタート時のメリットは、それほど誇張されたものではありません。 -
Kayla99r—もう後戻りはできません。 -
Grace_JacksonSr86—これを完全に自動化されたホスティングのブラック ボックスとして考えないでください。外部シーンの最大 TTFT と構造化された出力制約を明示的に記述し、残りはそれに任せました。ランニングコストと安定性は標準レベルに達していますが、前提条件として、制約付きで品質の収益を明確に定義する必要があります。そうしないと、実際にはコストを節約するためにエッジ ノードが選択される可能性があります。 -
c3p110—遅延に敏感なシナリオでは注意して使用してください。コスト管理にはいくつかのトレードオフがあります。 -
WAnderson_88—さまざまな API キーをさまざまなワークフローに割り当て、それぞれのトラフィック プロファイルを学習するためにエンジンを調整した後、コスト削減は当初よりもはるかに大きくなりました。最初からこれを行うことをお勧めします。すべてのトラフィックを 1 つのキーに混在させないでください。そうしないと、パターンを正確に識別することが困難になり、代わりに損失を被ることになります。本番、評価、実験の3つのキーセットに分けており、効果は即効性があります。 -
Candice249—フェイルオーバー フォールバック チェーンは透過的でチェックできるため、一部のブラック ボックス ゲートウェイよりも信頼性が高くなります。リクエストがどのパスをたどったか、コストはいくらか、再試行回数、毎回誰が到達したかを確認できます。これは、財務部門にコストを計上する必要がある私たちのようなチームにとって非常に重要です。 -
MsSteveCastro_2024—クロード・コードは直接答えました、クールです。 -
SHkra—当社のカスタマー サービス ロボットは 1 日に何百万ものトークンを生成し、トークンを受け取った後はコストが下がっていることが目に見えてわかります。ただし、外部シナリオに対してモデルを明示的にロックし、すべてを自動的に選択させる勇気はありませんでした。結局のところ、お金を節約することよりも、安定した顧客サービスのスキルの方が重要です。 -
AMfos—ZDR ポリシーによりポイントが加算されるため、コンプライアンス審査に合格しやすくなります。 -
CatherineBaker_99—キャッシュの持続性の問題はよく提起されています。創設者は、セッション中にも再評価され、キャッシュが冷えたら価格優先に戻るだろうと述べた。こういう細かいところを見ると、単にコスト削減を叫ぶだけではなく、きちんと理屈を理解しているのだと感じます。長期的なセッション テストを通じて、ルーティングは実際にウォーム キャッシュ プロバイダーに固定されており、1 ~ 2 セントを節約するために飛び回ることはできないことがわかりました。これは、多くのゲートウェイよりも安定しています。 -
JulieJenkins520731—予算管理ではキーごとに上限とアラームを設定できるため、ついに私たちの財務を監視する必要がなくなります。実稼働、プレリリース、開発の 3 つの環境は、個別の制限に分かれています。制限を超えた場合は直接アラームが送信されるので安心です。 -
VTUCGNJ2—確かに、定量チームによって行われたルーティングのロジックは、私自身の頭を叩くよりも信頼できます。 -
Jesse.Taylor_2021233—近いうちにさらに多くの国内モデルをサポートしたいと考えています。現在、主流モデルは十分ですが、十分に包括的ではありません。 -
Terry_Hicks_99—お会計は3分の1で済みましたが、とても美味しかったです。 -
WObau—正直に言うと、初期設定の敷居は低くありません。ルーティング戦略、制約、ZDR などの概念を最初に理解する必要があります。私たちは環境のセットアップとキーの割り当てに 1 日のほとんどを費やし、その効果を確認しました。 1~2モデルの調整で数量が少ない場合は、安い業者を直接見つけて指定場所で使用する方がコスト効率が良いと思います。このルーティング層を使用する必要はありません。大規模なチームにはそれだけの価値があります。 -
墨染_4—私が最も感心したのは、価格だけでなく、コストに迅速なキャッシュが含まれていることです。長時間のセッションが多く、キャッシュヒット直後は単価が下がります。しかし、構成は本当にプロフェッショナルです。初心者は、実際に制作を開始する前に、半日かけてドキュメントを読む必要があります。これは実際のしきい値です。 -
EStewart36934—ファウンダーの AMA では、キャッシュ ステータスは独立した信号として扱われ、予想されるコストはリクエストごとに再計算されます。この設計は「リクエストごとの貪欲な」デザインよりもはるかに安定しており、長いセッションでも揺れることはありません。セッションの途中でキャッシュがコールドになった場合でも、アカウントを再計算します。これは、ルーティングが現在のセッションだけでなくセッション全体のコストに実際に基づいていることを示しており、非常に確実です。 -
Victoria_CooperX80—値上げゼロ、これは本当に良心的ですね。 -
Dylan.Foster08—接続した後、コードを 1 行も変更せずに、base_url を変更しました。これは非常に便利です。 -
AnmolRamesh—LangChain への接続には数分しかかからないため、トラブルが軽減されます。