#evaluation
4件の記事が見つかりました
Loop Engineering 2026年8月12日
ループエンジニアリング完全ガイド:AIエージェントを安全に反復実行する設計
AIエージェントの実行・観測・評価・修正・停止を反復可能な仕組みにするループエンジニアリングを、コンテキスト・ハーネス・グラフとの違いから実践手順まで解説します。
loop-engineering ai-agent evaluation
Harness Engineering 2026年4月12日
ハーネスエンジニアリング完全ガイド:AIエージェントが働ける環境を設計する
AIエージェントへ指示・ツール・権限・状態・検証・観測可能性を与えるハーネスエンジニアリングを、OpenAIとAnthropicの実例から体系的に解説します。
harness-engineering ai-agent codex
Loop Engineering 2026年8月12日
評価と停止条件の設計:AIエージェントを正しく終わらせる
AIエージェントの反復を、自己申告ではなく証拠で完了判定する方法と、再試行・安全停止・人間へのエスカレーション条件を解説します。
loop-engineering evaluation stop-condition
Context Engineering 2026年4月12日
コンテキスト品質の評価と計測:RAGAS・DeepEvalで精度を数値化する
RAGシステムやLLMアプリケーションにおけるコンテキスト品質の評価手法を体系的に解説。Faithfulness、Context Precision、Relevancyなどの主要指標とRAGAS・DeepEvalの実践的な使い方を紹介します。
context-engineering evaluation rag