SEshop

LLMアプリケーション評価駆動開発 継続的に改善し運用していくための実践知【PDF版】 発売予定

上野 彰大(著) , 大嶋 勇樹(著)

商品番号
190860
販売状態
発売予定
納品形態
会員メニューよりダウンロード
発売日
2026年09月24日
ISBN
9784798190860
キーワード
プログラミング  開発手法  ビジネスIT  Web・アプリ開発  データ・データベース  人工知能・機械学習
制限事項
印刷可・テキストのコピー可
PDFの利用制限は商品ごとに異なります。
上記の「制限事項」欄をご確認ください。
  • 印刷可・テキストのコピー可
    Adobe Acrobat Reader などのPDF閲覧アプリで、問題なくご利用いただけるケースが多く確認されています。
    ※すべてのアプリでの動作を保証するものではありません。
  • 印刷不可・テキストのコピー不可
    「編集・印刷・コピー禁止」などの制限が設定されています。 一部のアプリでは、読み込み時にパスワード入力を求められる場合があります。
    ※パスワードはシステムにより自動生成されており、弊社でも確認・提供はできません。
本製品は電子書籍【PDF版】です。
PDFにはメールアドレスと著作権情報が埋め込まれます。
  • メールアドレスはご注文時のログインアドレスが使用されます。
  • Amazon Payの場合はAmazonアカウントのメールアドレスが使用されます。
無断の複製・転載・譲渡・共有・販売は法律により罰せられる可能性があります。
弊社ではPC版の「Adobe Acrobat Reader」を推奨しています。
Apple Booksなどその他のアプリでは注釈機能やハイライトが利用できません。

3,960円(税込)(本体3,600円+税10%)

360pt (10%)
ポイントの使い方はこちら

予約商品

初回購入から使えるポイント500円分プレゼント

紙の書籍はこちら 紙書籍とPDF版のセット商品はこちら

※1点の税込金額となります。 複数の商品をご購入いただいた場合のお支払金額は、 単品の税込金額の合計額とは異なる場合がございますので、予めご了承ください。

  • ポスト

「正解」がわからない出力を、どう評価するのか?
LLMアプリ特有の評価の基本から、継続的改善の運用方法まで徹底解説!

LLMアプリケーションを価値あるものにするためには、評価が欠かせません。
評価をすることではじめて、LLMアプリケーションの現在地を把握し、改善すべき方向性を見極めることができます。

しかし、LLMアプリケーションの評価は、
・出力が確率的かつ自由度が高いため単純に正答率を評価することができない
・なにをもって良い出力とするか、の軸が定めにくい
といったことから、「どう評価すればいいのか分からない」という課題にぶつかることが多くあるのではないでしょうか。

本書は、そういった課題を解決すべく、評価の種類、どういった評価指標を作っていくかはもちろん、近年注目されているLLM-as-a-Judgeを使った実際の評価、リリース後の評価・改善といった、基本から実務で使える知識まで解説します。

■本書の特徴
・評価の基本を網羅的に解説:評価の全体像から評価軸の考え方まで丁寧に解説していきます
・幅広い評価のアプローチの解説:最新の評価手法であるLLM-as-a-Judgeなども取り上げ、幅広い評価のアプローチを習得することで、あらゆる場面で最適な評価手法を選択・活用できる力を身につけられます
・実践力を身につけられる:実際にLangSmithを使ってLLMアプリケーションを評価し、運用・改善していく方法を紹介します。プロンプトのバージョンを管理し、LLMアプリケーションのモニタリングやトレースを行うことで、継続的にアプリケーションを改善するコツをしることができ、実践力を身につけられます

■こんな方におすすめ
・これからLLMを活用したアプリケーション開発をしようとしている方
・LLMを用いたサービスのリリースを検討しているが、評価に不安を感じている方
・すでにLLMを活用したアプリケーションを開発・運用しており、継続的に改善していきたいと考えている方

【目次】
第1章 なぜLLM アプリケーションを評価する必要があるの

第2章 LLMアプリケーション評価設計の全体像

第3章 LLMアプリケーション評価の実行プロセスと運用設計

第4章 評価指標の設定の考え方

第5章 LLM-as-a-Judge

第6章 LLMOpsによる継続的な改善

第7章 テーマ設定とサンプルアプリケーションの準備

第8章 評価の初期設計とデータセットの作成

第9章 リリース前の評価とチューニング

第10章 リリース後の評価と継続的な改善

付録 LLMそのものの評価

PDF版のご利用方法

  1. ご購入後、SEshopにログインし、会員メニューに進みます。
  2. ご購入電子書籍およびデータ > [ご購入電子書籍およびダウンロードデータ一覧]をクリックします。
  3. 購入済みの電子書籍のタイトルが表示されますので、リンクをクリックしてダウンロードしてください。
  4. PDF形式のファイルを、お好きな場所に保存してください。
  5. 端末の種類を問わず、ご利用いただけます。

第1章 なぜLLM アプリケーションを評価する必要があるの
1.1 評価が必要な理由 1.2 LLMアプリケーション特有の評価の難しさ 1.3 なにを評価すべきかはアプリケーションの目的次第 1.4 評価がチームにもたらすもの 1.5 評価の3つの目的 1.6 技術構成では変わらない評価の本質 1.7 評価が中心になる時代―評価駆動開発というAI時代のパラダイム 1.8 本章のまとめ

第2章 LLMアプリケーション評価設計の全体像 2.1 評価設計に必要な要素 2.2 「何のために(why)」評価するのか―評価の目的 2.3 「なにを(What)」評価するのか①―評価対象の設計 2.4 「なにを(What)」評価するのか②―評価観点・評価指標・評価基準の設計 2.5 本章のまとめ

第3章 LLMアプリケーション評価の実行プロセスと運用設計 3.1 「誰が(Who)」評価するのか―評価者の設計 3.2 「どのように(How)」評価するのか―評価データセットと評価方法の設計 3.3 「いつ(When)」評価するのか―評価タイミングの設計 3.4 「どこで(Where)」評価するのか―評価環境の設計 3.5 評価のゴールを定める―判断基準の設計 3.6 アプリケーションのライフサイクルと評価戦略の進化 3.7 本章のまとめ

第4章 評価指標の設定の考え方 4.1 LLMそのものとLLMアプリケーションの評価の違い 4.2 LLMそのものの評価をどう参照するか 4.3 LLMアプリケーションの評価 4.4 LLMアプリケーションの出力品質の評価 4.5 レイヤー1の出力品質を超えた評価 4.6 本章のまとめ

第5章 LLM-as-a-Judge 5.1 なぜLLM-as-a-Judgeを使うのか 5.2 LLM-as-a-Judgeの使い方 5.3 LLM-as-a-Judge使用上の注意点 5.4 評価の精度向上 5.5 本章のまとめ

第6章 LLMOpsによる継続的な改善 6.1 LLMOpsとは 6.2 LLMOpsの全体像:継続的改善サイクルという考え方 6.3 LLMOpsサイクルを支える実践基盤 6.4 LLMOpsを効率化するためのツール・サービス活用 6.5 改善手法の選択肢を広げる 6.6 本章のまとめ

第7章 テーマ設定とサンプルアプリケーションの準備 7.1 第2部のハンズオンの概要 7.2 テーマ設定 7.3 LangSmithのセットアップ 7.4 サンプルアプリケーションのセットアップと起動 7.5 LLMを使ったワークフロー処理の実装 7.6 本章のまとめ

第8章 評価の初期設計とデータセットの作成 8.1 評価の初期設計 8.2 データセットの作成準備 8.3 合成データセットの作成とブラッシュアップ 8.4 データセットの保存 8.5 本章のまとめ

第9章 リリース前の評価とチューニング 9.1 リリース前の評価の実装 9.2 人手での評価 9.3 評価指標の改善 9.4 評価結果に基づくチューニング 9.5 本章のまとめ

第10章 リリース後の評価と継続的な改善 10.1 リリース後の評価の実装 10.2 リリース後の評価を試す 10.3 リリース後の評価のモニタリング 10.4 本章のまとめ 10.5 第2部のおわりに

付録 LLMそのものの評価

各種問い合わせは以下のリンクからご連絡ください

おすすめ特集・キャンペーン

プログラミング本大特集

[特集]翔泳社のプログラミング書籍の中から、入門・初級者向けの書籍をピ…

紙とPDFのセット商品は、ポイント還元率UP!

[キャンペーン]ポイント還元率もUP!紙版とPDF版を併用したい方にお…

Python特集

[特集]Pythonのおすすめ本を入門~上級までレベル別・目的別にご紹…

ビジネスパーソンのための「現代の勉強法」と「一生モノの思考法」特集

[特集]令和の新しい学習術や、「図解・視覚化の技術」、AIやフレームワ…

保育士

[特集]保育士を目指している方にも、すでに保育現場で働き始めている方に…

生成AI

[特集]テキスト生成、画像生成、動画生成など、生成AI活用のスキルが身…

特集をもっと見る