Home › News › Choosing Not to Commit to One AI Model Can Be Cheaper and More Powerful, Study Finds
Technology
WEDNESDAY, JULY 22, 2026 ED.203
AIモデルを使い分けると最大50倍のコスト効率—Fireworks AIの研究が示す新戦略
Choosing Not to Commit to One AI Model Can Be Cheaper and More Powerful, Study Finds
Y By Yomimaru JLPT N4-N1
Jul 22, 2026 · 4 MIN READ
要約ようやく The story in English
Fireworks AI compares open and closed models, achieving 93% accuracy and 50x cost efficiency by selecting per task.
N4 N3 N1
Same story, every JLPT level. Tap a level to switch, and all levels are free.
みなさん 、 こんにちは 。 田中たなか です 。 今日きょう は 、 AI の 新しいあたらしい 使い方つかいかた について お伝えおつたえ し ます 。
Fireworks AI の 実験じっけん に よる と 、 AI モデル を 一つひとつ に 決めきめ ず に タスク ごと に 選ぶえらぶ と 、 性能せいのう が 上がりあがり 、 コスト も 大幅おおはば に 下がるさがる こと が わかり まし た 。 [ 1 ][ 2 ]
第1章: 実験の概要
Fireworks AI は 、 約やく 1 , 000 件けん の 「 エージェント 型がた タスク 」 を 使いつかい まし た 。 [ 1 ][ 2 ][ 3 ] これ は 、 AI が 自分じぶん で 考えかんがえ て 、 複数ふくすう の 手順てじゅん を 進めるすすめる タスク です 。 [ 1 ] タスク の 内容ないよう は 、 ソフトウェア の 修正しゅうせい 、 ターミナル の 操作そうさ 、 アルゴリズム 、 多言たげん 語ご の プログラミング 、 法律ほうりつ の 問題もんだい など 、 様々さまざま な もの が あり まし た 。 [ 1 ][ 3 ]
第2章: 2つのモデルの得意なこと
実験じっけん で は 、 オープン モデル の 「 Kimi K 3 」 と 、 クローズド モデル の 「 Fable 5 」 を 比べくらべ まし た 。 全体ぜんたい 的てき な 正答せいとう 率りつ は 、 どちら も ほとんど 同じおなじ でし た 。 例えばたとえば 、 ソフトウェア 修正しゅうせい の テスト で は 、 Kimi K 3 が 92 . 4 %、 Fable 5 が 92 . 6 % でし た 。 [ 3 ]
、 分野ぶんや ごと に 見るみる と 、 得意とくい ・ 不得意ふとくい が あり ます 。 Kimi K 3 は 、 ターミナル の 操作そうさ や 記号きごう 計算けいさん 、 開発かいはつ ツール が 得意とくい でし た 。 一方いっぽう 、 Fable 5 は 、 ウェブ 開発かいはつ や データ の 可視かし 化か 、 多言たげん 語ご の プログラミング が 得意とくい でし た 。 [ 1 ][ 2 ][ 3 ] 特にとくに 、 ターミナル を 長くながく 使うつかう タスク で は 、 Kimi K 3 だけ が 解けとけ た 問題もんだい が 11 件けん あり まし た 。 [ 1 ][ 3 ]
第3章: ルーティングの効果
AI は 、 タスク ごと に 最適さいてき な モデル を 選ぶえらぶ 「 ルーティング 」 という 方法ほうほう を 試しためし まし た 。 正解せいかい し た モデル の 中なか で 、 コスト が 安いやすい 方ほう を 選ぶえらぶ と 、 全体ぜんたい の 正答せいとう 率りつ は 93 % に なり まし た 。 [ 1 ][ 2 ][ 3 ] これ は 、 1 つ の モデル だけ を 使うつかう 場合ばあい より も 高いたかい 数字すうじ です 。 [ 2 ]
、 コスト 効率こうりつ も 大きくおおきく 改善かいぜん し まし た 。 長いながい エージェント 型がた タスク で は 、 Fable 5 だけ を 使うつかう 場合ばあい に 比べくらべ て 、 最大さいだい で 約やく 50 倍ばい も コスト 効率こうりつ が 良くよく なり まし た 。 [ 1 ][ 2 ][ 3 ] すべて の タスク の 分野ぶんや で 、 Kimi K 3 の 方ほう が Fable 5 より コスト が 低くひくく なり まし た 。 [ 2 ] 最ももっとも 良いよい 選択せんたく を する 「 オラクルルーティング 」 で は 、 タスク の 72 % から 96 % が Kimi K 3 に 割り当てわりあて られ まし た 。 [ 1 ][ 2 ]
第4章: 専門家の意見
AI の ブログ で は 、 「 1 つ の モデル だけ を 使うつかう の は 、 もう 最善さいぜん の 方法ほうほう で は ない 」 と 言っいっ て い ます 。 [ 2 ] これ は 、 AI モデル に も 得意とくい ・ 不得意ふとくい が あり 、 それ を 使い分けるつかいわける こと で 、 性能せいのう と コスト の 両方りょうほう を 良くよく できる 、 という 考え方かんがえかた です 。
の 分析ぶんせき で は 、 Kimi K 3 は トー クン 単価たんか が 安くやすく て も 、 出力しゅつりょく が 長くながく なる こと が ある ため 、 実際じっさい の コスト は 思っおもっ た ほど 安くやすく ない 場合ばあい も ある と 指摘してき し て い ます 。 [ 6 ] しかし 、 今回こんかい の 実験じっけん の よう な 長いながい タスク で は 、 やはり Kimi K 3 の 安やす さ が 大きなおおきな 利点りてん に なり ます 。 [ 1 ][ 4 ]
第5章: まとめ
の 実験じっけん は 、 オープン モデル と クローズド モデル を うまく 使い分けるつかいわける こと が 大切たいせつ だ と 示ししめし て い ます 。 皆さんみなさん も 、 AI を 使うつかう とき は 、 1 つ の モデル に こだわら ず に 、 目的もくてき に 合っあっ た モデル を 選んえらん で み て は いかが でしょ う か 。
、 田中たなか が お伝えおつたえ し まし た 。 また 次回じかい お 会いあい し ましょ う 。
スタジオより
皆さんみなさん 、 こんばんは 。 ニュースキャスター の 田中たなか です 。 今夜こんや は 、 AI モデル の 使い方つかいかた に関するにかんする 新しいあたらしい 研究けんきゅう を ご 紹介しょうかい し ます 。 Fireworks AI という 会社かいしゃ が 、 オープン モデル の 「 Kimi K 3 」 と クローズド モデル の 「 Fable 5 」 を 比較ひかく し まし た 。 その 結果けっか 、 1 つ の モデル に こだわら ず 、 課題かだい に 合わせあわせ て 使い分けるつかいわける こと で 、 最大さいだい 50 倍ばい の コスト 効率こうりつ と 93 % の 高いたかい 精度せいど が 得え られる こと が わかり まし た 。 [ 1 ][ 2 ]
第1章: ふたつのAIモデルを比較した実験
Fireworks AI は 、 約やく 1000 件けん の エージェント 型がた タスク で Kimi K 3 と Fable 5 を テスト し まし た 。 [ 1 ][ 2 ] タスク に は 、 ソフトウェア の バグ 修正しゅうせい や ターミナル を 使っつかっ た セキュリティ 作業さぎょう 、 競技きょうぎ プログラミング 、 6 種類しゅるい の プログラミング 言語げんご による 実装じっそう 、 法律ほうりつ に関するにかんする 問題もんだい など が 含まふくま れ て い まし た 。 [ 1 ] 全体ぜんたい の 性能せいのう は ほぼ 同じおなじ でし た が 、 細かくこまかく 見るみる と 、 モデル によって 得意とくい な 分野ぶんや が 違っちがっ て い まし た 。 [ 1 ]
第2章: モデルごとの得意分野とコストの差
Kimi K 3 は 、 記号きごう 計算けいさん や 開発かいはつ ツール の 使用しよう で 強いつよい 結果けっか を 出しだし まし た 。 [ 1 ] 一方いっぽう 、 Fable 5 は Web 開発かいはつ や データ の 可視かし 化か で 高いたかい 成績せいせき を 記録きろく し まし た 。 [ 1 ] ターミナル を 長時間ちょうじかん 使うつかう 課題かだい で は 、 Kimi K 3 の ほう が 優秀ゆうしゅう で 、 89 件けん の うち Kimi K 3 だけ が 解けとけ た 問題もんだい が 11 件けん 、 Fable 5 だけ が 解けとけ た 問題もんだい は 7 件けん でし た 。 [ 1 ]
性能せいのう だけ で なく 、 コスト に も 大きなおおきな 差さ が あり まし た 。 Kimi K 3 の API 料金りょうきん は 、 100 万まん トーク ン の 入力にゅうりょく で 3 ドル 、 出力しゅつりょく で 15 ドル です 。 [ 4 ][ 9 ] 一方いっぽう 、 Fable 5 は 入力にゅうりょく 10 ドル 、 出力しゅつりょく 50 ドル と 、 約やく 3 倍ばい の 価格かかく です 。 [ 4 ][ 9 ] さらに 、 同じおなじ タスク を 終わらおわら せる ため に 必要ひつよう な 処理しょり の 回数かいすう や データ 量りょう も 影響えいきょう し ます 。 [ 1 ] 例えばたとえば 、 ソフトウェア 修正しゅうせい で は Kimi K 3 の 処理しょり 量りょう が 多くおおく なり まし た が 、 ターミナル 課題かだい で は Fable 5 の 処理しょり が 長引きながびき まし た 。 [ 1 ] 特にとくに 長時間ちょうじかん の エージェント 型がた タスク で は 、 Kimi K 3 は Fable 5 より 最大さいだい で 約やく 50 倍ばい も コスト 効率こうりつ が 良くよく なり まし た 。 [ 1 ][ 2 ]
第3章: 課題に合わせてモデルを選ぶ「ルーティング」の力
Fireworks AI が 提案ていあん し た 解決かいけつ 策さく は 、 課題かだい ごと に 最適さいてき な モデル を 選ぶえらぶ 「 ルーティング 」 です 。 [ 1 ] 実験じっけん で は 、 両方りょうほう の モデル で 問題もんだい を 解いとい た 後のち 、 正解せいかい し た モデル の うち 、 費用ひよう が 安いやすい ほう を 選ぶえらぶ という 方法ほうほう を 試しためし まし た 。 [ 1 ] この 方法ほうほう は 「 オラクルルーティング 」 と 呼ばよば れ 、 理論りろん 上じょう の 最善さいぜん の 結果けっか を 示ししめし ます 。 [ 1 ] その 結果けっか 、 全体ぜんたい の 正答せいとう 率りつ は 93 % に 達したっし まし た 。 [ 1 ][ 2 ][ 3 ] これ は 、 どちら か 1 つ の モデル だけ を 使うつかう より も 高いたかい 精度せいど です 。 [ 2 ] また 、 タスク の 72 % から 96 % が 、 より 安いやすい Kimi K 3 に 割り当てわりあて られ まし た 。 [ 1 ]
この 研究けんきゅう は 、 1 つ の AI モデル に こだわら ず 、 タスク によって 使い分けるつかいわける こと で 、 高いたかい 品質ひんしつ と 低いひくい コスト の 両方りょうほう を 実現じつげん できる こと を 示ししめし て い ます 。 [ 2 ][ 3 ] Fireworks AI は 、 オープン モデル を 基本きほん として 使いつかい 、 ルーター で 継続けいぞく 的てき に 最適さいてき な 組み合わせくみあわせ を 学ぶまなぶ こと を 勧めすすめ て い ます 。 [ 3 ]
第4章: 専門家の見方 — これからのAI活用
専門せんもん 家か は 、 この 結果けっか について 「 Kimi K 3 の 本当ほんとう の 強みつよみ は 、 すべて の 分野ぶんや で 1 位い を 取るとる こと で は なく 、 トップクラス の モデル に 近いちかい 結果けっか を 低てい コスト で 出せるだせる こと に ある 」 と 指摘してき し て い ます 。 [ 4 ][ 7 ] また 、 API の 単価たんか だけ で なく 、 実際じっさい に タスク を 完了かんりょう さ せる ため に かかる 総そう 費用ひよう で 比較ひかく する こと の 重要じゅうよう 性せい も 強調きょうちょう さ れ て い ます 。 [ 6 ] 企業きぎょう が AI を 活用かつよう する 際さい は 、 モデル の 順位じゅんい で は なく 、 自社じしゃ の 課題かだい に 合っあっ た 「 配置はいち 」 を 考えるかんがえる べき だ という 意見いけん も あり ます 。 [ 6 ]
スタジオから
今回こんかい の 研究けんきゅう は 、 AI を 利用りよう する 企業きぎょう にとって 、 大きなおおきな ヒント に なる でしょ う 。 モデル を 使い分けるつかいわける こと で 、 同じおなじ 予算よさん で より 多くおおく の 仕事しごと を こなせる かも しれ ませ ん 。 以上いじょう 、 田中たなか が お伝えおつたえ し まし た 。 ご 視聴しちょう ありがとう ござい まし た 。
東京とうきょう の スタジオ から 生なま 中継ちゅうけい の 田中たなか です 。 本日ほんじつ は 、 企業きぎょう の AI 活用かつよう における 常識じょうしき を 覆すくつがえす 研究けんきゅう 結果けっか を お伝えおつたえ し ます 。 生成せいせい AI 基盤きばん を 提供ていきょう する Fireworks AI が 、 オープン モデル 「 Kimi K 3 」 と クローズド モデル 「 Fable 5 」 を 比較ひかく し た ところ 、 単一たんいつ モデル に 依存いぞん する より も 、 タスク に 応じおうじ て 最適さいてき な モデル を 選択せんたく する 「 ルーティング 」 手法しゅほう が 、 正答せいとう 率りつ 93 % と 最大さいだい 50 倍ばい の コスト 効率こうりつ を 達成たっせい する こと が 明らかあきらか に なり まし た 。 [ 1 ][ 2 ]
第1章:実験の概要──約1000のエージェント型タスクで徹底比較
Fireworks AI は 、 ソフトウェア の 不具合ふぐあい 修正しゅうせい 、 ターミナル を 使っつかっ た セキュリティ 作業さぎょう 、 競技きょうぎ プログラミング 、 6 種類しゅるい の プログラミング 言語げんご による 実装じっそう 、 法律ほうりつ 関連かんれん の 問題もんだい など 、 合計ごうけい 約やく 1000 件けん の エージェント 型がた タスク を 両りょう モデル に 実行じっこう さ せ まし た 。 [ 1 ][ 3 ] これら の タスク は 、 AI が 複数ふくすう の 手順てじゅん を 自律じりつ 的てき に 進めるすすめる 高度こうど な 内容ないよう です 。
その 結果けっか 、 全体ぜんたい として の 性能せいのう は ほぼ 互角ごかく でし た が 、 詳細しょうさい に 分類ぶんるい する と 明確めいかく な 得意とくい 分野ぶんや が 浮かび上がりうかびあがり まし た 。 [ 1 ] SWE ベンチマーク で は 、 Kimi K 3 が 92 . 4 %、 Fable 5 が 92 . 6 % と 拮抗きっこう 。 [ 3 ] しかし 、 記号きごう 計算けいさん や 開発かいはつ ツール 関連かんれん で は Kimi K 3 が 優位ゆうい に 立ちたち 、 ウェブ 開発かいはつ や データ の 可視かし 化か で は Fable 5 が 高いたかい 成績せいせき を 収めおさめ まし た 。 [ 1 ][ 2 ] さらに 、 ターミナル を 長時間ちょうじかん 操作そうさ する 89 件けん の 課題かだい で は 、 Kimi K 3 だけ が 11 件けん を 解決かいけつ し 、 Fable 5 だけ が 7 件けん を 解決かいけつ 。 暗号あんごう 解析かいせき や 脆弱ぜいじゃく 性せい 調査ちょうさ で 差さ が 生じしょうじ た と 報告ほうこく さ れ て い ます 。 [ 1 ]
第2章:コストが明暗を分ける──最大50倍の効率差
が 近いちかい 一方いっぽう で 、 コスト に は 大きなおおきな 開きひらき が あり まし た 。 API 料金りょうきん は 、 Kimi K 3 が 入力にゅうりょく 100 万まん トーク ン 当たりあたり 3 ドル 、 出力しゅつりょく 15 ドル ( キャッシュ 利用りよう 時じ は 入力にゅうりょく 0 . 3 ドル ) で ある の に対しにたいし 、 Fable 5 は 入力にゅうりょく 10 ドル 、 出力しゅつりょく 50 ドル 。 [ 4 ][ 9 ] この 定価ていか 差さ に 加えくわえ 、 タスク あたり の 処理しょり 回数かいすう や データ 量りょう も 総そう 費用ひよう に 影響えいきょう し ます 。
AI の 分析ぶんせき で は 、 Kimi K 3 は 5 つ の 全ぜん 分野ぶんや で Fable 5 より 低てい コスト と なり 、 長時間ちょうじかん の エージェント 型がた タスク で は 最大さいだい 約やく 50 倍ばい の コスト 効率こうりつ を 記録きろく し まし た 。 [ 1 ][ 2 ] たとえば 、 Artificial Analysis による 実測じっそく で は 、 1 タスク あたり の 平均へいきん 費用ひよう は Kimi K 3 が 4 . 65 ドル 、 Fable 5 が 21 . 63 ドル と 、 4 倍ばい 以上いじょう の 差さ が 確認かくにん さ れ て い ます 。 [ 4 ][ 7 ] もっとも 、 Kimi K 3 は 出力しゅつりょく トーク ン が 多くおおく なる 傾向けいこう が あり 、 実質じっしつ コスト が 縮まるちぢまる 場合ばあい も ある ため 、 モデル 単価たんか だけ で 判断はんだん でき ない 点てん に 注意ちゅうい が 必要ひつよう です 。 [ 6 ]
第3章:鍵を握る「ルーティング」──93%の正答率を実現
AI が 提示ていじ し た 解決かいけつ 策さく が 、 タスク ごと に モデル を 振り分けるふりわける 「 ルーティング 」 です 。 実験じっけん で は 、 両りょう モデル に 問題もんだい を 解かとか せ た 後のち 、 正解せいかい し た モデル の うち 費用ひよう が 安いやすい 方ほう を 選ぶえらぶ 「 オラクルルーティング 」 と 呼ばよば れる 手法しゅほう を 適用てきよう し まし た 。 [ 1 ] これ は 理論りろん 上じょう の 上限じょうげん を 示すしめす もの です が 、 分野ぶんや に 応じおうじ て 72 %~ 96 % の タスク が Kimi K 3 に 割り当てわりあて られ 、 全体ぜんたい の 正答せいとう 率りつ は 93 % に 達したっし 、 どちら か 単一たんいつ モデル を 上回るうわまわる 結果けっか と なり まし た 。 [ 1 ][ 2 ][ 3 ]
成果せいか は 、 特定とくてい タスク に 最適さいてき な モデル を 動的どうてき に 選ぶえらぶ こと で 、 品質ひんしつ と コスト を 両立りょうりつ できる こと を 示ししめし て い ます 。 Fireworks AI は 、 オープン モデル を デフォルト と し つつ 、 ルーター が 継続けいぞく 的てき に タスク と モデル の 最適さいてき な 組み合わせくみあわせ を 学習がくしゅう する アーキテクチャ を 推奨すいしょう し て い ます 。 [ 3 ]
第4章:専門家の見解──「万能モデル信仰」の終わり
動向どうこう に 詳しいくわしい 専門せんもん 家か から は 、 この 結果けっか を 「 単一たんいつ モデル に 固執こしつ する 時代じだい の 終わりおわり 」 と 評価ひょうか する 声こえ が 上がっあがっ て い ます 。 中国ちゅうごく 発はつ の オープン モデル で ある Kimi K 3 が 、 性能せいのう 面めん で クローズド モデル に 迫りせまり つつ 、 圧倒的あっとうてき な コスト 優位ゆうい 性せい を 示ししめし た こと は 、 企業きぎょう の AI 調達ちょうたつ 戦略せんりゃく に 大きなおおきな 影響えいきょう を 与えるあたえる と み られ て い ます 。 [ 4 ][ 7 ] 実際じっさい 、 一部いちぶ の ベンチマーク で は Kimi K 3 が 最さい 上位じょうい に 立つたつ わけ で は あり ませ ん が 、 「 上位じょうい モデル に 近いちかい 結果けっか を 低てい コスト で 出すだす 点てん が 本当ほんとう の 脅威きょうい 」 と 指摘してき さ れ て い ます 。 [ 7 ]
の 展望てんぼう として 、 モデル 単体たんたい の 優劣ゆうれつ で は なく 、 複数ふくすう モデル を 状況じょうきょう に 応じおうじ て 使い分けるつかいわける 「 マルチ モデル 戦略せんりゃく 」 が 主流しゅりゅう に なる 可能かのう 性せい が 高まったかまっ て い ます 。 開発かいはつ 現場げんば で は 、 短いみじかい 精密せいみつ な タスク に は GPT 系けい 、 大だい 規模きぼ 設計せっけい に は Fable 5 、 超ちょう 長文ちょうぶん ・ 反復はんぷく 作業さぎょう に は Kimi K 3 といった 使い分けつかいわけ が 現実げんじつ 的てき だ と さ れ て い ます 。 [ 6 ]
第5章:まとめ──企業が取るべきアクション
の 研究けんきゅう から 得え られる 教訓きょうくん は 明快めいかい です 。 特定とくてい の AI モデル に 依存いぞん する の で は なく 、 タスク の 特性とくせい に 応じおうじ て 最適さいてき な モデル を 選択せんたく する 仕組みしくみ を 構築こうちく する こと で 、 高いたかい 精度せいど と 大幅おおはば な コスト 削減さくげん を 同時にどうじに 実現じつげん でき ます 。 Fireworks AI の 実験じっけん は 理論りろん 上じょう の 上限じょうげん を 示ししめし た もの です が 、 すでに 実用じつよう 的てき な ルーター 開発かいはつ へ の 道筋みちすじ を つけ た と 言えるいえる でしょ う 。 [ 1 ][ 2 ] 各かく 企業きぎょう は 、 自社じしゃ の 業務ぎょうむ 内容ないよう を 精査せいさ し 、 モデル ごと の 得意とくい 分野ぶんや を 活かしいかし た ポートフォリオ 戦略せんりゃく を 早急そうきゅう に 検討けんとう する 必要ひつよう が あり ます 。
の ニュース 、 田中たなか が お伝えおつたえ し まし た 。
❖
Sources 7
This is an original Japanese adaptation written by Yomimaru for learners. Read the full reporting at the sources above to support the original publishers.
質問しつもん
Questions & answers
What is "Choosing Not to Commit to One AI Model Can Be Cheaper and More Powerful, Study Finds" about? Fireworks AI compares open and closed models, achieving 93% accuracy and 50x cost efficiency by selecting per task.
What JLPT level is this Japanese news story? This story is available at JLPT N4–N1. Yominews rewrites the same news at every level with furigana above the kanji, so you can read it at your level and switch levels with the tabs on the page. Reading is free and needs no account.
Where does this Japanese news story come from? This is an original Japanese-language adaptation written by Yomimaru for learners, based on reporting from gigazine.net, fireworks.ai, www.chaincatcher.com and other outlets. It is not a republished source article; the original reporting is linked in the sources.
Read this in Yomimaru
Tap any word for instant lookups, ask Tomo-Sensei to explain the grammar, and save words to your own study deck.
Open in Yomimaru →
Read at your level
Every Yominews story is adapted to each level. Pick yours.
Beginner Elementary Intermediate Advanced Native-level