ModelVerify

免费、匿名的 AI 模型验真平台,通过指纹比对判断第三方 API 端点是否真的运行它所宣称的模型

詳細レポート

  • ModelVerify.ai は、開発者および企業向けの「匿名所有キー (BYOK) モデル検証プラットフォーム」です。その中心的な使命は、AI API の「信頼問題」に対する独立した証拠を提供することです。ユーザーは、サードパーティ API エンドポイント (ベース URL)、モデル ID、独自の API キーを入力するだけで済みます。プラットフォームは、診断プローブを通じてエンドポイントの動作と公式モデルの「フィンガープリント」を比較し、それが主張通りのモデルであるかどうかを判断します。 API ブローカーとシェル モデルが蔓延している現在、このツールは実際の高頻度の問題点を解決します。料金を払って電話をかける「Claude Opus」が、その背後で安価な Haiku を実行している可能性があります。

  • ModelVerify.ai の公式の位置づけは、「AI API に透明性をもたらす - すべての人のための独立したモデル検証」です。それは、サードパーティの API 転送ステーションやモデルの砲撃詐欺など、長い間無視されてきた闇の産業チェーンを指摘しています。 2026年3月、ドイツのCISPAヘルムホルツ情報セキュリティセンターは調査報告書「リアルマネー、フェイクモデル:シャドウAPIにおける欺瞞モデルの主張」を発表し、テストサンプル中のシャドウAPIエンドポイントの最大45.83%がモデル置換詐欺、つまり、有料の最上位モデルを装うために安価なオープンソースモデルが使用され、その結果、187件の学術論文の評価データさえも歪曲されたことが判明した。このような背景から、ModelVerify.ai は「モデル検証」を研究テーマから誰でも無料で使用できる公開証拠レイヤーに変換します。同プラットフォームは現在、親会社や財務情報を公開しておらず、チームの背景も明らかにされていない。しかし、その公開証拠レイヤーは、過去 30 日間で 8,838 件を超えるエンドポイント検証、443 件の新規検証を完了し、合計 1,586 件以上の「矛盾していると主張される」エンドポイントが発見されました。

  • 検証プロセスは非常に簡単です。ユーザーは、アカウントを登録せずに、公式 Web サイトにアクセスし、ベース URL、モデル ID、API キーを入力して開始します。プラットフォームは、ターゲット エンドポイントに一連の診断プローブを送信し、返された動作パターンを実際の公式エンドポイントから収集した「既知の良好なフィンガープリント」と比較し、最終的に判定 (一致 / 不一致)、互換性スコア (0 ~ 1、1 に近いほど公式モデルに近い)、リスク レベル、安定性インデックス、および遅延データを提供します。たとえば、ホームページに表示された最近の検証バッチでは、api.vilao.ai の claude-opus-4-8 互換性はわずか 0.67 で、高リスクの不一致であると判断されますが、vip.j3gb.com の gpt-5.5 互換性は 0.80、安定性は 100% で、低リスクの一致と判断されます。 単一の検証に加えて、プラットフォームは 2 つの常駐機能も提供します。 1 つは「公式サプライヤー ドリフト モニター (モデル ドリフト モニター)」です。OpenAI、Azure OpenAI、Anthropic、AWS Bedrock の公式フィンガープリントが 6 時間ごとに収集され、ベースラインと比較されます。ステータスは、緑 (正常)、黄 (観察)、オレンジ (ドリフトの疑い)、赤 (ドリフト確認)、灰色 (古いデータ) の 5 色でマークされます。クラウド ベンダーのルーティング変更による公式モデル ベースラインの汚染を避けるために、OpenAI と Azure の GPT、Anthropic、Bedrock の Claude が個別に追跡されることは注目に値します。たとえば、モニタリングによると、GPT-5.5/OpenAI のドリフト スコアは 1.3 (観測値) であるのに対し、Claude Opus 4.8/Anthropic は 0.7 (通常) です。 2 つ目は「公式モデル ベンチマーク リスト (baseline_150)」です。これは、0 から 1 のスコアを使用して、推論、コーディング、ツール呼び出し、レイテンシーの 4 つの側面で主流モデルをランク付けします。これは厳密なベンチマークではなく、機能の参照としてのみ使用されます。

  • ModelVerify.ai は現在完全に無料で匿名であり、アカウントは必要ありません。そのビジネス モデルはまだ公開されていませんが、製品形態の点では、直接収益化される SaaS というよりも「公共インフラストラクチャ/ブランド トラスト ツール」に近いものです。ユーザーは自分のキーを持ち込んで (BYOK)、プラットフォームは API 呼び出し料金を請求せず、蓄積された公的証拠レイヤーに依存して業界の基準値を確立します。プラットフォームによる API キーの処理には、匿名の位置付けも反映されます。キーは Redis に一時的にのみ保存され、現在の実行にのみ使用されます。実行が完了するとすぐに削除され、PostgreSQL やファイル ストレージに書き込まれることはありません。フロントエンドは復号化されたキーを決して表示しません。検証レポートは保存され、「レポート コード」を通じてアクセスされます。匿名テスト レポートは、有効期限が切れる前にこのコードによってのみアクセスでき、永久アカウントにバインドされません。

  • 製品の発売はドキュメントのリリースに比較的近いため (ドキュメントは 2026 年 6 月に集中しています)、パブリック チャネルにはまだ多数の独立したユーザーの長いレビューが蓄積されておらず、明確な Product Hunt リリース ページは見つかりませんでした。参照「ユーザーシグナル」は主にその公開証拠レイヤー自体から来ています。過去 30 日間で 443 の新しい検証が追加され、合計 1,586 を超える矛盾したエンドポイントが見つかりました。これは、かなりの数の開発者と中継ステーションのユーザーが実際の購入前の検証にこのレイヤーを使用したことを示しています。インタラクションデザインの観点から、「偽のモデルを購入するのではないかという不安」という交通機関 API 購入者の中核的な不安に対処します。しきい値が低く、すぐに結果が得られるエクスペリエンス (ほとんどの検証は数秒から 20 秒以上で完了します) は、開発者ツールの習慣と一致しています。

  • 業界の「モデル検証」に対する需要は急速に高まっています。 CISPA の調査により、「シャドウ API モデルの置き換え」が、社内の噂からデータによって裏付けられたセキュリティ問題に変わりました。国内外のメディア (Tencent News、Zhihu、Sohu など) は、2026 年 3 月の「本物のお金で偽モデルを購入する」事件を集中的に報道しました。偽の AI API を検出することを目的とした GitHub の llm-verify プロジェクトなど、同様のアイデアを持つツールがオープンソース コミュニティでも登場しました。 ModelVerify.ai の独自性は、指紋比較を 1 回限りのローカル スクリプトではなく「継続的に更新される公開証拠レイヤー」にし、公式モデル ドリフト モニタリングを重ね合わせることで、同様のツールの中でも「業界ベンチマーク プロバイダー」に近いものになっています。

  • 誤解のないように、ModelVerify.ai の判断は「判断」ではなく「証拠」です。当局者らは、決定は遅延、安定性、ドリフト信号に基づいて行われるべきだと繰り返し強調してきた。単一の「不一致」は必ずしも不正を意味するわけではなく、モデルのバージョンの違いや構成の問題である可能性もあります。次に、指紋の適用範囲によって検証の精度が決まります。プラットフォーム上に公式のフィンガープリントがない不人気モデルの場合、結果の参考値は限られています。さらに、匿名プラットフォームであるため、サプライヤーからのコンプライアンスの承認は得られず、ユーザーは依然として独自のテストとサプライヤーの評判に基づいて決定を下す必要があります。最後に、プラットフォーム チームと運営主体は開示されておらず、長期的な可用性とデータ ポリシーについては不確実性があります。

  • このツールは、AI アプリケーション開発者、API 転送ステーションの購入者、モデル評価を行う研究者、特にトラフィックをサードパーティの LLM API またはゲートウェイにルーティングするものの、その背後にある実際のモデルを確認できないチームによって使用する価値があります。使用上のアドバイスは非常に簡単です。特定のエンドポイントへの運用トラフィックを削減する前に、まずそのエンドポイントで検証を実行し、互換性スコアが 1 に近いかどうか、リスクが低いかどうか、安定性が 100% であるかどうかに焦点を当てます。同時に、公式ドリフト監視に注意を払って、信頼している公式モデルに最近の機能低下が発生していないことを確認してください。これを「サプライヤー信用承認の完全な基礎」とみなすのは適切ではありません。これは、「この会社が信頼できるかどうか」ではなく、「このエンドポイントが宣言されたモデルのように動作するかどうか」に答えるものです。代替手段には、自作プローブの比較、オープンソースの llm-verify、および Ofox や API-CHECK などの同様の中国の検証ツールが含まれます。

  • ModelVerify.ai は、長らく過小評価されてきた信頼の脆弱性を、無料、匿名、再利用可能な公開証拠レイヤーのための実用的なツールに変えました。これは、AI API の調達および評価リンクの「リリース前チェックリスト」に追加する価値のあるリンクです。その価値は、指紋の適用範囲と公的証拠の層の蓄積によって増大し続けるでしょう。

ユーザーレビュー

  • 头像
    LIsul_x
    客观说一句,别把它当尚方宝剑。它给的是「行为像不像宣称模型」的证据,不是供应商信用背书。我一般会结合三点:兼容性分数接近 1、稳定性 100%、再去看官方漂移监测确认模型本身没退化,三样齐全才放心切流量。冷门模型没指纹的,它也没辙,这时候还是得自己写探针兜底。

  • 头像
    JTorres_Pro559
    API Key 只暂存 Redis、跑完就删,这点比那些要你注册绑定账号的检测站放心。不过官方漂移监测我更看重,GPT-5.5/OpenAI 最近漂移分 1.3 进观察态,说明连官方自身都在变,验真不是一劳永逸。

  • 头像
    TJohnson_Max
    免费的,先冲了。

  • 头像
    熊丹怡
    报告码能留着复盘,挺贴心的设计。

  • 头像
    angrybear295
    做科研评测的注意了,有论文因为用了假 API 数据直接失真。我现在凡是接第三方端点,先丢进 ModelVerify 验一遍,兼容性、风险、稳定性三项都绿才敢用,比盲信商家 description 靠谱一万倍。

  • 头像
    桃花753
    终于有个能验真模型的了。

  • 头像
    brownbutterfly366
    匿名还不用注册,这点很对我胃口,怕留痕迹。

  • 头像
    TOada
    研究说市面上 45% 以上的中转存在偷梁换柱,我本来半信半疑,自己拿 ModelVerify 跑了十几个端点才信。最离谱的一个声称 gpt-5.5,兼容性 0.06,稳定性还只有 33%,明显是拿别的东西顶包。这种工具早该有了。

  • 头像
    星辰_7
    跟 API-CHECK、Ofox 比,它胜在公共证据层,能看到别人验过的端点,省得每家都自己踩一遍。

  • 头像
    Jeffrey_RichardsonZ
    说真的,光看商家宣传根本分不清真假,延迟、稳定性、漂移一起看才有意义。单次不匹配不一定是欺诈,也可能是版本差异,别一棍子打死。

  • 头像
    xNicolasGutiérrez_dev
    拿它测了手头五个中转,三个都是不匹配,其中一个 gpt-5.5 兼容性只有 0.06,基本就是拿开源模型糊弄人。以后买额度前必验。

  • 头像
    MBennettSr
    兼容性分数 0.67 直接判高风险,比我肉眼比对准多了。

  • 头像
    iMayaFleury_dev
    团队做 AI 编程助手,高频调 Claude,官方价扛不住只能走中转。以前全靠运气,现在上线前先拿它跑一遍,兼容性低于 0.9 的坚决不上生产。

  • 头像
    夏轩
    之前用某中转,跑出来居然是 Haiku 顶着 Opus 的名,血亏。

  • 头像
    Sofia223
    踩过坑才懂这东西的价值。去年团队图便宜买了个 Claude 中转,跑代码老降智,排查两周才发现后端根本不是 Opus,而是拿便宜模型顶着名卖。要是当时有 ModelVerify,输个 Base URL 和 Key 十几秒就能看兼容性分数,也不至于白烧那么多 token 和工时。现在它已经是我采购中转前的固定一步了。

  • 头像
    宋红
    中转站水太深了。