AI学習

ベンチマーク

ベンチマーク

9件の記事

AI大将が、左手に同じ大きさの2枚のコイン(Fable 5.1とAstraの同額の価格札)を持ち、右手で『実費は半額以下』のレシートとFable 5.1を示す小さな王冠マークの両方を指し示している図
生成AI(LLM)AI学習AI関連ニュース ChatGPTClaudeGeminiベンチマーク

2026秋・新作AIリリース祭り|GPT-6 Astra、コーディングはFable 5.1に匹敵。実費は半額以下で、総合指数は変わらずFable 5.1が1位です

OpenAIが2026年9月3日に正式発表したGPT-6 Astraを、Claude Fable 5.1・Opus 5・GPT-5.6 Sol・Gemini 3.8 Flashと同じ条件で比較します。価格は入力10ドル・出力50ドルとFable 5.1と完全に同額。OpenAI自身が公開したグラフの多くはコストと出力トークン数を軸にしており、『速さ』と『コスト効率』を前面に出した発表です。実際、コーディングエージェント指数ではFable 5.1と肩を並べるスコアを実費半額以下で記録し、パソコン操作の自動化ではGPT-5.6 Solより47%短い時間で高いスコアを出しています。一方で総合指数は61.3点、Fable 5.1(66点)には届かず1位は変わらずFable 5.1のまま。①コーディングと③最後までやり切る自動操作ではこのシリーズ初の首位に立つ一方、②調べ物・知識は指標によって顔が変わり、数学の難問(FrontierMath Tier 4)では大差で首位でも、ツールを使った幅広い知識問題(Humanity's Last Exam)ではFable 5.1に劣ります。サイバー能力は史上初の『Critical』判定を受け、高度な機能はアルファテスターに限定。作業別の向き不向きと、自分の仕事にどちらが合うかを解説します。確認日は2026年9月4日です。『2026秋・新作AIリリース祭り』シリーズの3本目。

記事を読む
AI大将が、左手に小型の精密ドライバー(コーディング特化)と虫眼鏡(調べ物・リサーチ)、右手に自動操縦のハンドル(最後までやり切る自動操作)を持ち、ハンドルだけ少し重そうにしている図
生成AI(LLM)AI学習AI関連ニュース GeminiClaudeChatGPTベンチマーク

2026秋・新作AIリリース祭り|Gemini 3.8 Flash、コーディングも調べ物も互角。『やり切る』作業だけ、まだ差があります

Googleが2026年9月2日(日本時間9月3日未明)に発表したGemini 3.8 Flashを、Claude Fable 5.1・Opus 5・GPT-5.6 Sol/Terraと同じ条件で比較します。コーディング(DeepSWE)ではOpus 5とほぼ同点の73.7%、調べ物・知識系(GPQA Diamond・AA-LCR・LABBench2)でも軒並り上位。一方、複数ツールを横断して最後までやり切る作業(Terminal-Bench・OSWorld)では、昨日発表されたばかりのFable 5.1にもOpus 5にも届きません。単価は据え置きなのに、実測タスクコストは前モデルから約40%上がっているという第三者報告も。作業別の向き不向きと、自分の仕事にどちらが合うかを解説します。確認日は2026年9月3日です。「2026秋・新作AIリリース祭り」シリーズの2本目。

記事を読む
AI大将が、Claude Fable 5.1のスコア表と価格タグを両手に持ち、片方が上向き矢印、もう片方が実費の吹き出しを指している図
生成AI(LLM)AI学習AI関連ニュース ClaudeChatGPTGeminiベンチマーク

Claude Fable 5.1登場。総合スコアは世界一、でも1タスクの実費は20%上がってます

Anthropicが2026年9月1日に公開したClaude Fable 5.1を、GPT-5.6 Sol/Terra/Luna・Gemini 3.6/3.7 Flashと同じ条件で比較します。Artificial Analysis Intelligence Indexで66点と世界一になった一方、1タスクあたりの実費はFable 5より約20%上がったとの報告も。「安くなった」のからくりと、自分の使い方でどちらに転ぶかを解説します。確認日は2026年9月2日です。

記事を読む
AI大将が、推論レベルのつまみと、単価の札・トークン量のメーターを並べて説明している図
AI学習お悩み別生成AI(LLM) ベンチマークClaudeChatGPTGeminiAIを体系的に学びたい

AIの性能ベンチマーク【番外編】推論レベルを上げたら、料金はどうなるん?

Claudeのeffort、GPTのreasoning_effort、Geminiのthinking_level。同じモデルのまま推論レベルを上げると料金はどうなるのか。答えは「単価は変わらず、消費する出力トークンが増える」です。3社の公式ドキュメントと、Artificial Analysisのeffort別実コストデータで確認しました。Claude Opus 5はxhighとmaxが同じ63点なのに、コストは$927違います。確認日は2026年8月20日です。

記事を読む
AI大将が、6モデルの総合点と料金を並べた表の前で、配点の内訳を開いて説明している図
AI学習お悩み別生成AI(LLM) ベンチマークClaudeChatGPTGeminiAIを体系的に学びたい

AIの性能ベンチマーク|総合点と値段。6モデルを並べたら順位が変わった

Claude Opus 5・GPT-5.6 Sol/Terra/Luna・Gemini 3.7 Flash・Claude Sonnet 5の6モデルを、Artificial Analysis Intelligence Indexと API料金で比較します。総合点の中身を開けると、エージェント関連が34%を占める配点でした。入力単価は25倍差、総合点は11ポイント差。どちらの言い方も成立しない理由を説明します。確認日は2026年8月19日です。

記事を読む
AI大将が、積み上がった資料の山とグラフ・領収書を前にして、読む力を測る試験を説明している図
AI学習お悩み別生成AI(LLM) ベンチマークClaudeChatGPTGeminiAIを体系的に学びたい

AIの性能ベンチマーク|大量の資料と画像を読む力を測る9つ(AA-LCR・GDP.pdf・LMArena)

LongBench、AA-LCR、GDP.pdf、DocVQA、ChartQA、MMMU、MMMU-Pro、OCRBench、LMArena。長い資料・PDF・グラフ・画像を読む力を測る9つのベンチマークを、それぞれ4点で説明します。「コンテキストウィンドウ100万トークン」と「100万トークンを正確に扱える」が別物である理由も、AA-LCRの設計から解説します。

記事を読む
AI大将が、始まりから終わりまで一本につながった作業の道のりを指しながら、やり切る力を説明している図
AI学習お悩み別生成AI(LLM) ベンチマークClaudeChatGPTGeminiAIを体系的に学びたい

AIの性能ベンチマーク|仕事を最後までやり切る力を測る8つ(SWE-bench・Terminal-Bench・τ-bench)

SWE-bench、SWE-bench Verified、SWE-bench Pro、HumanEval、Terminal-Bench、BFCL、τ-bench、IFEval、AutomationBench。「賢さ」ではなく「作業を最後までやり切れるか」を測る指標を、それぞれ4点で説明します。AIが文字数や形式の指示を守らないのは何の性能の問題なのか、GPT-4でも76.89%という数字から解説します。

記事を読む
AI大将が、知識と推論を測る8つのベンチマークを並べた一覧表を指しながら説明している図
AI学習お悩み別生成AI(LLM) ベンチマークClaudeChatGPTGeminiAIを体系的に学びたい

AIの性能ベンチマーク|知識と推論を測る8つ(MMLU・GPQA・HLE)

MMLU、MMLU-Pro、GPQA、GPQA Diamond、HLE、AIME、TruthfulQA、AA-Omniscience。知識と推論を測る8つのベンチマークを、それぞれ「どんな問題を解かせるか」「人間に例えると何か」「点数が高いと実際に何ができるのか」「誰には関係が薄いか」の4点で説明します。GPQAが検索し放題でも34%しか取れない理由まで書きました。

記事を読む
AI大将が、パーセントの数字と「何の割合?」という問いを並べたボードを指しながら説明している図
AI学習お悩み別生成AI(LLM) ベンチマークClaudeChatGPTGeminiAIを体系的に学びたい

AIの性能ベンチマークって、その数字は何の割合なん?|読み方の基本

AIの性能ベンチマークで「30.4%」「1588」と書かれていても、それが何の数字なのか分かりにくいままになっています。この記事では、パーセントの3つの型(正答率・pass@1・部分点なしの全条件クリア)と、Arenaのスコアがパーセントではない理由を、公式の採点方法から説明します。数字を見たときに確認する5つの項目まで持ち帰れます。

記事を読む