実践記事

AI学習

AI学習

23件の記事

AI大将が、左手に同じ大きさの2枚のコイン(Fable 5.1とAstraの同額の価格札)を持ち、右手で『実費は半額以下』のレシートとFable 5.1を示す小さな王冠マークの両方を指し示している図
生成AI(LLM)AI学習AI関連ニュース ChatGPTClaudeGeminiベンチマーク

2026秋・新作AIリリース祭り|GPT-6 Astra、コーディングはFable 5.1に匹敵。実費は半額以下で、総合指数は変わらずFable 5.1が1位です

OpenAIが2026年9月3日に正式発表したGPT-6 Astraを、Claude Fable 5.1・Opus 5・GPT-5.6 Sol・Gemini 3.8 Flashと同じ条件で比較します。価格は入力10ドル・出力50ドルとFable 5.1と完全に同額。OpenAI自身が公開したグラフの多くはコストと出力トークン数を軸にしており、『速さ』と『コスト効率』を前面に出した発表です。実際、コーディングエージェント指数ではFable 5.1と肩を並べるスコアを実費半額以下で記録し、パソコン操作の自動化ではGPT-5.6 Solより47%短い時間で高いスコアを出しています。一方で総合指数は61.3点、Fable 5.1(66点)には届かず1位は変わらずFable 5.1のまま。①コーディングと③最後までやり切る自動操作ではこのシリーズ初の首位に立つ一方、②調べ物・知識は指標によって顔が変わり、数学の難問(FrontierMath Tier 4)では大差で首位でも、ツールを使った幅広い知識問題(Humanity's Last Exam)ではFable 5.1に劣ります。サイバー能力は史上初の『Critical』判定を受け、高度な機能はアルファテスターに限定。作業別の向き不向きと、自分の仕事にどちらが合うかを解説します。確認日は2026年9月4日です。『2026秋・新作AIリリース祭り』シリーズの3本目。

記事を読む
AI大将が、左手に小型の精密ドライバー(コーディング特化)と虫眼鏡(調べ物・リサーチ)、右手に自動操縦のハンドル(最後までやり切る自動操作)を持ち、ハンドルだけ少し重そうにしている図
生成AI(LLM)AI学習AI関連ニュース GeminiClaudeChatGPTベンチマーク

2026秋・新作AIリリース祭り|Gemini 3.8 Flash、コーディングも調べ物も互角。『やり切る』作業だけ、まだ差があります

Googleが2026年9月2日(日本時間9月3日未明)に発表したGemini 3.8 Flashを、Claude Fable 5.1・Opus 5・GPT-5.6 Sol/Terraと同じ条件で比較します。コーディング(DeepSWE)ではOpus 5とほぼ同点の73.7%、調べ物・知識系(GPQA Diamond・AA-LCR・LABBench2)でも軒並り上位。一方、複数ツールを横断して最後までやり切る作業(Terminal-Bench・OSWorld)では、昨日発表されたばかりのFable 5.1にもOpus 5にも届きません。単価は据え置きなのに、実測タスクコストは前モデルから約40%上がっているという第三者報告も。作業別の向き不向きと、自分の仕事にどちらが合うかを解説します。確認日は2026年9月3日です。「2026秋・新作AIリリース祭り」シリーズの2本目。

記事を読む
AI大将が、Claude Fable 5.1のスコア表と価格タグを両手に持ち、片方が上向き矢印、もう片方が実費の吹き出しを指している図
生成AI(LLM)AI学習AI関連ニュース ClaudeChatGPTGeminiベンチマーク

Claude Fable 5.1登場。総合スコアは世界一、でも1タスクの実費は20%上がってます

Anthropicが2026年9月1日に公開したClaude Fable 5.1を、GPT-5.6 Sol/Terra/Luna・Gemini 3.6/3.7 Flashと同じ条件で比較します。Artificial Analysis Intelligence Indexで66点と世界一になった一方、1タスクあたりの実費はFable 5より約20%上がったとの報告も。「安くなった」のからくりと、自分の使い方でどちらに転ぶかを解説します。確認日は2026年9月2日です。

記事を読む
AI大将が、修了バッジと目安4時間・実測3時間という実測メモを手にしている図
生成AI(LLM)AI学習 ClaudeAIエンジニアリング

AI活用力コース、目安4時間→実測3時間。学んだのは「操作」やのうて「責任の持ち方」やった

Claude Academyの「AI活用力:フレームワーク&基礎」を実際に受講。目安4時間が実測3時間で終わり、修了バッジ第1号を獲得した記録。Delegation・Description・Discernment・Diligenceの4Dの中身と、いちばん実務に効いた気づきを届けます。

記事を読む
AI大将が、Claude Academyの2つの入口(Claude製品を学ぶ/AI Fluencyで基礎を学ぶ)を指し示している図
生成AI(LLM)AI学習 ClaudeAIエンジニアリング

Claude Academyって、結局何なん?25コースは「2つの入口」に分かれてました

Anthropicの無料学習プラットフォーム「Claude Academy」が2026年8月24日に日本語対応しました。実際に開いてみると、25件のコースは「Claude製品を学ぶ」と「AI Fluencyで基礎を学ぶ」の2つの入口に分かれていました。今日試すべきチュートリアルの正確な所要時間と、AI大将が実際に4コースを受講しながら書く全6回シリーズの全体像を紹介します。

記事を読む
AI大将が、推論レベルのつまみと、単価の札・トークン量のメーターを並べて説明している図
AI学習お悩み別生成AI(LLM) ベンチマークClaudeChatGPTGeminiAIを体系的に学びたい

AIの性能ベンチマーク【番外編】推論レベルを上げたら、料金はどうなるん?

Claudeのeffort、GPTのreasoning_effort、Geminiのthinking_level。同じモデルのまま推論レベルを上げると料金はどうなるのか。答えは「単価は変わらず、消費する出力トークンが増える」です。3社の公式ドキュメントと、Artificial Analysisのeffort別実コストデータで確認しました。Claude Opus 5はxhighとmaxが同じ63点なのに、コストは$927違います。確認日は2026年8月20日です。

記事を読む
AI大将が、6モデルの総合点と料金を並べた表の前で、配点の内訳を開いて説明している図
AI学習お悩み別生成AI(LLM) ベンチマークClaudeChatGPTGeminiAIを体系的に学びたい

AIの性能ベンチマーク|総合点と値段。6モデルを並べたら順位が変わった

Claude Opus 5・GPT-5.6 Sol/Terra/Luna・Gemini 3.7 Flash・Claude Sonnet 5の6モデルを、Artificial Analysis Intelligence Indexと API料金で比較します。総合点の中身を開けると、エージェント関連が34%を占める配点でした。入力単価は25倍差、総合点は11ポイント差。どちらの言い方も成立しない理由を説明します。確認日は2026年8月19日です。

記事を読む
AI大将が、積み上がった資料の山とグラフ・領収書を前にして、読む力を測る試験を説明している図
AI学習お悩み別生成AI(LLM) ベンチマークClaudeChatGPTGeminiAIを体系的に学びたい

AIの性能ベンチマーク|大量の資料と画像を読む力を測る9つ(AA-LCR・GDP.pdf・LMArena)

LongBench、AA-LCR、GDP.pdf、DocVQA、ChartQA、MMMU、MMMU-Pro、OCRBench、LMArena。長い資料・PDF・グラフ・画像を読む力を測る9つのベンチマークを、それぞれ4点で説明します。「コンテキストウィンドウ100万トークン」と「100万トークンを正確に扱える」が別物である理由も、AA-LCRの設計から解説します。

記事を読む
AI大将が、始まりから終わりまで一本につながった作業の道のりを指しながら、やり切る力を説明している図
AI学習お悩み別生成AI(LLM) ベンチマークClaudeChatGPTGeminiAIを体系的に学びたい

AIの性能ベンチマーク|仕事を最後までやり切る力を測る8つ(SWE-bench・Terminal-Bench・τ-bench)

SWE-bench、SWE-bench Verified、SWE-bench Pro、HumanEval、Terminal-Bench、BFCL、τ-bench、IFEval、AutomationBench。「賢さ」ではなく「作業を最後までやり切れるか」を測る指標を、それぞれ4点で説明します。AIが文字数や形式の指示を守らないのは何の性能の問題なのか、GPT-4でも76.89%という数字から解説します。

記事を読む
AI大将が、知識と推論を測る8つのベンチマークを並べた一覧表を指しながら説明している図
AI学習お悩み別生成AI(LLM) ベンチマークClaudeChatGPTGeminiAIを体系的に学びたい

AIの性能ベンチマーク|知識と推論を測る8つ(MMLU・GPQA・HLE)

MMLU、MMLU-Pro、GPQA、GPQA Diamond、HLE、AIME、TruthfulQA、AA-Omniscience。知識と推論を測る8つのベンチマークを、それぞれ「どんな問題を解かせるか」「人間に例えると何か」「点数が高いと実際に何ができるのか」「誰には関係が薄いか」の4点で説明します。GPQAが検索し放題でも34%しか取れない理由まで書きました。

記事を読む
AI大将が、パーセントの数字と「何の割合?」という問いを並べたボードを指しながら説明している図
AI学習お悩み別生成AI(LLM) ベンチマークClaudeChatGPTGeminiAIを体系的に学びたい

AIの性能ベンチマークって、その数字は何の割合なん?|読み方の基本

AIの性能ベンチマークで「30.4%」「1588」と書かれていても、それが何の数字なのか分かりにくいままになっています。この記事では、パーセントの3つの型(正答率・pass@1・部分点なしの全条件クリア)と、Arenaのスコアがパーセントではない理由を、公式の採点方法から説明します。数字を見たときに確認する5つの項目まで持ち帰れます。

記事を読む
AI大将が、一人前に仕事をするようになったAI社員の隣で、5つの設計思想の使い分け表を示している図
AI学習お悩み別生成AI(LLM)AIエージェント AIエンジニアリングClaudeChatGPTAIを体系的に学びたいCodexClaude Code

うちのAI社員、いまどこでつまずいてる?5つの見分け方

AIがうまく動かないとき、5つのうちどれを足せばいいのか。いま起きていることから選べる1枚の表と、5つが入れ子の1つのシステムだという関係を整理します。シリーズ全7回の最終回です。

記事を読む
AI大将が、赤ペンの入った書類を受け取った新人のAI社員に、別の担当が見た指摘を説明している図
AI学習お悩み別AIエージェント AIエンジニアリングAIを体系的に学びたいCodexClaude Code

自分の仕事に、自分で赤ペンは入れられない|ループエンジニアリング

AIの出したものの質が安定しない原因は、同じAIに確認させていることにあります。作らせたAIと採点させるAIを分ける考え方、合格基準の決め方、そして回すほどかかるコストまで解説します。

記事を読む
AI大将が、机と道具箱を用意された新人のAI社員に、開けていい引き出しと開けたらいけない引き出しを示している図
AI学習お悩み別AIエージェント AIエンジニアリングMCPAIを体系的に学びたいCodexClaude Code

机も道具もない部屋で、人は働けない|ハーネスエンジニアリング

AIに任せたいけれど事故が怖い。その線引きが、ハーネスエンジニアリングです。道具・制限・権限・ルールの4つで決める考え方と、チャット画面だけでもすでにできていることを解説します。

記事を読む
AI大将が、引き継ぎ資料のファイルを抱えた新人のAI社員に、渡す資料を選んで手渡している図
AI学習お悩み別生成AI(LLM) AIエンジニアリングClaudeChatGPTAIを体系的に学びたい

引き継ぎ資料を渡さずに、仕事はできへん|コンテキストエンジニアリング

AIが前提を知らないのは、渡していないからです。何を・いつ・どれだけ読ませるかの選び方と、渡しすぎると忘れ始める理由を解説します。ファイル添付とカスタム指示だけで、今日からできます。

記事を読む
AI大将が、指示書を手にした新人のAI社員に、役割・条件・形式・禁止事項の4項目を説明している図
AI学習お悩み別生成AI(LLM) AIエンジニアリングClaude何から始めたらいいか分からないChatGPTAIを体系的に学びたい

新人に「いい感じにやっといて」は通じない|プロンプトエンジニアリング

AIに指示しても思った通りに返ってこない原因は、頼み方にあります。役割・条件・形式・禁止事項の4つで書く型と、多くの人が抜かしている「やってほしくないこと」の書き方を解説します。

記事を読む
AI大将が、名札だけをつけた新人のAI社員を隣に立たせ、5つの設計思想を書いた板を示している図
AI学習お悩み別生成AI(LLM)AIエージェント AIエンジニアリングClaudeChatGPTAIを体系的に学びたいCodexClaude Code

AIを「雇う」と考えたら、5つの設計思想が全部つながった│5つのAIエンジニアリング

プロンプト・コンテキスト・ハーネス・ループ・グラフ。5つのAI設計思想は、どれも「人を1人雇って育てる」話と同じ構造をしています。AIを"使う"から"雇う"へ視点を切り替えて、5つの関係を整理します。

記事を読む
AI大将が「取るのは3日分だけでいい」と伝えながら、Day1からDay5のカードのうちDay1〜3を指し示しているサムネイル
AI学習お悩み別pillar-829b348022 バイブコーディング何から始めたらいいか分からない毎日の作業を減らしたいAntigravity

非エンジニアと小規模事業者は、この講座のどこだけ使えばいいか|捨てる部分と、明日から使う部分

Google×KaggleのAIエージェント5日間講座を、従業員数人の会社と非エンジニアの視点で仕分けしました。Day1からDay3は取る、Day4は考え方だけ、Day5は読むだけ。その理由と、最初の1件を選ぶ手順、そのまま真似できるSKILL.mdの記入例と業務選定ワークシートまで、すべて公開します。

記事を読む
AI大将がノートパソコンの前で、Day1からDay5までの5枚のカードを指し示しながら『中身、全部見せます』と伝えているサムネイル
AI学習お悩み別 バイブコーディングAIを体系的に学びたいAntigravity

Google×Kaggle「AIエージェント5日間講座」の中身|Day1からDay5まで、ホワイトペーパー・ポッドキャスト・コードラボを全部読み解く

MCP、エージェントスキル、仕様駆動開発。35万人が学んだ講座の専門用語を、実際のコードラボの中身まで含めて日本語で解説します。各日の教材(ホワイトペーパー・ポッドキャスト・コードラボ)への直リンク付き。

記事を読む
AI大将が「35万人が受けた講座、中身を確認します」と伝えながら、Googleとkaggleのロゴを指し示しているサムネイル
AI学習お悩み別ai-llm バイブコーディング何から始めたらいいか分からないGeminiAIを体系的に学びたい

35万人が受けたGoogle×Kaggle「AIエージェント5日間講座」とは|今から無料で受けられる範囲と修了バッジの現状

Googleとkaggleが開催した35万3,000人規模の無料AIエージェント講座を整理。教材は今も無料で公開されている一方、修了バッジと証明書の付与条件はどうなっているのかを公式情報で確認し、今から受ける手順と必要な準備まで解説します。

記事を読む