> category_air
Generative AI, RAG & Agents
RAG architecture documents, Agentic-RAG workflows, multi-agent responsibility matrices, and AI risk registers for production LLMs.
Important Tech Document Template & Operational Notice
TinyCTO.tv Tech Document Template Notice: This template is a general educational and operational starting point. It is not legal, tax, accounting, investment, procurement, regulatory, security or certification advice. Requirements vary by jurisdiction, organization, contract and risk. Review and adapt it with qualified professionals before relying on it.

Agent Deployment and Production-Readiness Review
Comprehensive pre-flight deployment gate and verification checklist assessing autonomous agents across canary rollouts, fallback safety, rate-limit quotas, prompt injection hardening, observability coverage, and rollback readiness.

Agent Evaluation Dataset and Scenario Catalogue
Governed benchmark repository and test scenario catalogue documenting task complexity tiers, edge-case injections, user persona variants, multi-turn reasoning traps, and verified ground-truth trajectories for continuous agent regression testing.

Agent Evaluation, Simulation and Test Plan
Rigorous agentic evaluation and simulation framework standardizing multi-step trajectory evaluation, tool-calling accuracy, task completion rates (Pass@k), synthetic benchmark environments, mock tool harnesses, and LLM-as-a-judge grading criteria.

Agent Failure, Fallback and Recovery Plan
Operational resilience plan and deterministic recovery runbook standardizing agent error classification, recursive loop detection, context-window overflow recovery, model degradation fallbacks, and human-in-the-loop dead-letter queue (DLQ) replay workflows.

Agent Handoff and Context-Transfer Protocol
Inter-agent communication specification and context-transfer protocol governing typed payloads, conversational state transfer, intent preservation, role-swapping safeguards, idempotency tokens, and lossy-context degradation prevention.

Agent Identity, Credential and Permission Design
Zero Trust security architecture and privilege delegation design for autonomous AI agents, standardizing workload identities (SPIFFE/OIDC), short-lived ephemeral token minting, on-behalf-of (OBO) user authorization chains, OAuth scope attenuation, and audit-logged non-repudiation envelopes.

Agent Incident-Response Runbook
Operational incident response protocol standardizing severity classification (SEV1-SEV4), containment workflows, forensic memory triage, poisoned context sanitization, and stakeholder notifications during autonomous agent security and reliability failures.

Agent Interoperability and Protocol Decision Record
Architectural decision record and protocol specification evaluating cross-agent communication standards, Anthropic Model Context Protocol (MCP), gRPC vs JSON-RPC transport layers, agent identity headers, and state serialization schemas.

Agent Memory and State Specification
Production architecture and engineering specification defining autonomous agent short-term working memory (scratchpad / conversation context), long-term episodic memory, semantic memory retrieval, state compaction pipelines, and TTL pruning policies.

Agent Observability, Trace and Audit Specification
Distributed tracing, telemetry instrumentation, and immutable audit specification standardizing OpenTelemetry spans for agent thought chains, tool invocation latencies, token consumption waterfalls, step-level replayability, and tamper-resistant logging.

Agent Tool and Capability Registry
Enterprise AI agent tool orchestration and execution governance registry cataloging deterministic API tools, Model Context Protocol (MCP) server endpoints, input JSON schema contracts, rate limits, write-action confirmation gates, and blast-radius risk classifications.

Agent Tool-Security, Approval and Transaction-Control Plan
Enterprise security governance and transaction-control framework establishing strict capability-based authorization, two-man rule Human-in-the-Loop (HITL) approval gates for irreversible actions, cryptographic tool request signing, and parameter injection sanitization.

AI Governance Operating Model and Control Catalogue
Enterprise artificial intelligence governance operating model and comprehensive control catalogue establishing AI ethics committee charters, multi-tier risk classification schemas (Unacceptable, High, Limited, Minimal), lifecycle approval gates, and continuous compliance registers under ISO/IEC 42001 and the EU AI Act.

AI Incident-Response Plan and Runbook
Operational incident response plan and crisis runbook governing AI-specific emergencies: massive hallucination outbreaks, prompt injection compromises, toxic output generation, training data poisoning, unauthorized agentic tool execution, and statutory regulatory breach notifications under EU AI Act Article 73.

AI Red-Team Plan and Findings Register
Adversarial AI safety assessment plan and vulnerability register evaluating foundation models and agentic RAG architectures against direct/indirect prompt injection, jailbreaking, training data exfiltration, system prompt extraction, model inversion, and tool abuse under OWASP LLM and MITRE ATLAS frameworks.

AI Risk Register
Dynamic AI risk catalog quantifying prompt injection, hallucination, data leakage, unbounded tool abuse, and cost overrun vectors.

AI Safety Case and Assurance-Evidence Pack
Formal AI safety engineering framework establishing Claims-Arguments-Evidence (CAE) and Goal Structuring Notation (GSN) assurance architectures, hazard identification matrices, empirical validation registries, boundary condition guardrails, and regulatory safety case dossiers for high-risk autonomous systems.

AI System Card
Comprehensive end-to-end AI system disclosure and operational transparency document detailing intended purpose, operational boundaries, prohibited use cases, underlying foundation models, human-in-the-loop oversight mechanisms, benchmark evaluation evidence, and known algorithmic failure modes under EU AI Act Article 13.

AI System Inventory and Accountability Register
Enterprise-wide AI and machine learning system registry recording statutory risk tiers (Unacceptable, High, Limited, Minimal under the EU AI Act), model lineage, training data dependencies, deployment context, designated business/technical owners, and ongoing impact assessment statuses.

AI System Requirements & Production-Readiness Plan
Comprehensive readiness gate framework validating benchmark accuracy, guardrail defense, latency limits, fallback circuits, and drift monitoring.

AI Vendor/Model Provider Due-Diligence Pack
Commercial AI procurement and foundation model due-diligence framework assessing third-party model providers on training data consent, copyright indemnification, zero-data-retention (ZDR) architecture, enterprise SLA commitments, and regulatory supply-chain compliance under EU AI Act Article 25.

RAG Architecture Document & Production Specification
Production architecture specification for Retrieval-Augmented Generation (RAG) systems covering ingestion pipelines, chunking, hybrid retrieval, cross-encoder re-ranking, grounding policies, and the RAG Triad evaluation framework.

Agentic-RAG Workflow & Tool Contract
Production-grade specification for autonomous ReAct cognitive loops, strict JSON Schema tool calling contracts, execution sandboxing, human-in-the-loop intercepts, and RAG Triad evaluation.

Autonomous-Action Audit Ledger Specification
Tamper-evident, cryptographically verifiable audit ledger architecture standardizing chronological transaction recording, cryptographic chain-of-custody, SHA-256 Merkle tree verification, and WORM storage compliance for all high-stakes autonomous agent actions.

Chunking Strategy and Experiment Workbook
Analytical RAG chunking trade-off evaluation workbook comparing fixed-token, recursive character, semantic similarity, and document-structure chunking algorithms across chunk sizes (256, 512, 1024 tokens), overlap percentages (10-25%), and retrieval recall impact.

Content-Safety and Moderation Policy/Decision Matrix
Comprehensive input/output AI moderation and trust-and-safety framework establishing category harm taxonomies (hate, violence, self-harm, sexual, PII, prompt injection, jailbreaks), severity scoring thresholds, multi-tier enforcement actions (block, redact, warn, human review), and audit logging compliant with the EU AI Act.

Data and AI Strategy and Roadmap
Strategic enterprise framework defining multi-year data architecture modernisation, AI platform capabilities, data governance pillars, and high-ROI operational use case roadmaps.

Embedding-Model Evaluation and Selection Pack
Decision matrix and benchmark scoring workbook for dense and sparse vector embeddings, evaluating MTEB retrieval accuracy, dimensional size (384 to 3072 dims), Matryoshka dimension truncation, inference latency (TTFT), multilingual capabilities, and token pricing.

Fine-Tuning/Adaptation Dataset and Job Specification
End-to-end foundation model adaptation specification establishing instruction-tuning dataset curation, prompt-response formatting, parameter-efficient fine-tuning (PEFT / LoRA / QLoRA) hyperparameters, compute budgeting, loss tracking, and catastrophic forgetting mitigation.

Foundation-Model Evaluation and Benchmark Pack
Rigorous empirical evaluation and benchmarking framework for foundation models and LLMs assessing standardized capabilities (MMLU, GSM8K, HumanEval, HELM), domain-specific task accuracy, latency/throughput curves, context window degradation, and token inference economics.

GenAI Evaluation and Regression Suite Specification
Automated generative AI evaluation and regression testing specification establishing curated golden test datasets, LLM-as-a-Judge calibrated rubrics, Ragas retrieval metrics (faithfulness, answer relevance, context recall), CI/CD deployment gates, and statistical regression assertions.

Generative AI Use-Case Canvas
Strategic assessment canvas evaluating generative AI opportunities across business viability, algorithmic feasibility, hallucination tolerance, and intellectual property exposure.

Grounding, Citation and Source-Attribution Policy
Strict epistemic governance and transparency policy for enterprise generative AI and RAG assistants, standardizing factual grounding thresholds, zero-unsupported claim mandates, deterministic refusal protocols when context is missing, inline citation formats, and source verification audit logs.

Human Intervention and Kill-Switch Runbook
Emergency incident response runbook establishing immediate kill-switch mechanisms, graceful agent shutdown protocols, state rollbacks, queue draining, human takeover procedures, and forensic flight-recorder memory dumping during runaway or rogue autonomous agent events.

Human-Oversight, Intervention and Escalation Plan
Statutory human oversight and intervention framework establishing operational Human-in-the-Loop (HITL), Human-on-the-Loop (HOTL), and Human-in-Command (HIC) governance architectures, confidence score review thresholds, real-time manual override triggers, and circuit-breaking kill-switch protocols for autonomous AI systems.

Knowledge Freshness, Re-indexing and Deletion Plan
Production RAG data lifecycle and corpus governance plan standardizing automated re-indexing triggers, document obsolescence/TTL pruning, partial vs full re-embedding pipelines, GDPR/CCPA Article 17 "Right to be Forgotten" hard vector deletion protocols, and index drift telemetry.

Knowledge-Source Inventory and Authority Register
Authoritative data governance register for Retrieval-Augmented Generation (RAG) and enterprise AI systems indexing corporate knowledge sources, establishing content ownership, authority ranking, confidentiality classification, sync frequency, and deprecation sunset lifecycle.

LLM Gateway, Routing, Fallback and Resilience Design
Production-grade AI gateway and model router architecture defining unified API abstraction, dynamic semantic cost/latency routing, multi-provider automated failover, token rate-limiting, semantic caching, and circuit breaker patterns to eliminate LLM provider outages and reduce inference spending.

LLM Observability, Tracing and Quality-Monitoring Plan
Production LLM application observability and runtime tracing architecture establishing OpenTelemetry GenAI semantic conventions, distributed prompt-completion span graphs, token consumption and cost attribution telemetry, latency monitoring (TTFT), real-time hallucination drift detection, and PagerDuty alerting policies.

Model-Selection ADR and Decision Matrix
Architectural Decision Record (ADR) and quantitative multi-criteria decision matrix evaluating proprietary API frontier models (OpenAI, Anthropic) versus self-hosted open-weights models (Llama, Mistral, Qwen) across data sovereignty, fine-tuning viability, cold-start latency, and total cost of ownership (TCO).

Multi-Agent Authority & Responsibility Matrix
Governance framework defining autonomous agent capabilities, maximum execution authorities, financial transaction thresholds, sandboxing boundaries, and human-in-the-loop escalation circuits.

Multi-Agentic-RAG Topology and Interaction Map
Architectural blueprint and interaction topology specification governing hierarchical multi-agent RAG systems, supervisor-worker orchestration, routing agents, specialized retrieval worker nodes, and deterministic graph state transitions.

Planner-Executor Contract
Formal interface and state machine contract governing decomposed multi-step agentic systems, standardizing task decomposition DAG schemas, step precondition validation, intermediate state scratchpads, dynamic replanning triggers upon tool failures, and deterministic loop-termination bounds.

Prompt Specification & Change Record
Engineering specification and version control standard for production system prompts, detailing few-shot exemplars, input variable schemas, injection defenses, and regression test suites.

RAG Evaluation Plan
Methodological benchmarking plan evaluating retrieval precision, groundedness, and answer relevance with CI/CD regression gates.

RAG Ingestion and Transformation Specification
High-throughput document ingestion and data normalization specification for Retrieval-Augmented Generation (RAG) pipelines codifying multimodal document parsing (PDF, DOCX, HTML, PPTX), metadata enrichment, table layout extraction, OCR fallbacks, and PII cleansing.

RAG Observability and Retrieval-Diagnostics Plan
Production operational telemetry and diagnostic runbook for RAG pipelines standardizing query trace telemetry, chunk relevance scoring, zero-retrieval drop alerting, user negative feedback triage (thumbs down), embedding drift monitoring, and query latency heatmaps.

RAG Security, Access-Control and Privacy Plan
Enterprise defense-in-depth security architecture for RAG systems establishing document-level access control lists (ACLs) pre-filtering, cryptographic multi-tenant vector index partitioning, pre-embedding PII sanitization, indirect prompt injection defense, and vector deletion compliance.

Responsible/Acceptable AI Use Policy Builder
Comprehensive corporate acceptable-use policy builder and employee governance framework establishing permissible, restricted, and strictly prohibited AI applications, confidential data ingestion boundaries, open-source/commercial model procurement rules, intellectual property protection, and copyright attribution guidelines.

Retrieval Strategy and Retrieval Test Specification
Enterprise hybrid information retrieval architecture and empirical benchmarking specification codifying dense semantic search, sparse lexical BM25 matching, Reciprocal Rank Fusion (RRF), cross-encoder re-ranking, query expansion/HyDE, and automated Recall@k / NDCG@k test suites.

Sandboxed Agent Execution and Resource-Policy Specification
MicroVM and containerized isolation architecture standardizing isolated dynamic code execution environments, ephemeral scratchpads, strict egress firewall policies, CPU/memory quotas, and zero-trust sidecar proxies for untrusted agent-generated code.

Token, Latency and Cost Budget Workbook
Granular modeling workbook and unit economics tracker establishing token allocation budgets per agentic subtask, Time-to-First-Token (TTFT) latency SLAs, cache-hit optimization economics, and programmatic spend hard-caps across LLM providers.

Vector-Database Evaluation and Selection Matrix
Comprehensive architecture trade-off evaluation matrix comparing specialized vector databases (Pinecone, Qdrant, Milvus, Weaviate) against relational extensions (pgvector) across indexing algorithms (HNSW vs IVF), hybrid BM25 full-text search, metadata filtering latency, and cloud hosting TCO.
