{
  "schema_version": 1,
  "slug": "nemotron-voicechat-11b",
  "model": "NVIDIA-NemotronLabs-VoiceChat-11B",
  "developer": "NVIDIA",
  "modality": {
    "input": ["audio"],
    "output": ["audio", "user transcript"]
  },
  "serving_profile": {
    "engine": ".wave",
    "kernel": "Wave Persistent Kernel (WPK)",
    "hardware": "1× NVIDIA H100 SXM 80 GB",
    "model_step_ms": 80,
    "steps_per_beat": 2,
    "deadline_ms": 160,
    "context_steps": 1500,
    "context_seconds": 120,
    "timing_boundary": "server",
    "precision": {
      "perception_and_backbone": "BF16",
      "recurrent_state": "FP32",
      "tts_codec_and_recognition": "FP32",
      "matrix_multiplication": "TF32",
      "tts_attention_cache": "FP32"
    }
  },
  "headline_result": {
    "status": "measured",
    "sessions": 56,
    "highest_tested": true,
    "p99_ms": {
      "min": 147.4,
      "max": 147.5
    },
    "late_beats": 0,
    "measured_beats": 84000,
    "runs": 3
  },
  "landing_comparisons": {
    "reference": "NVIDIA pinned NIM, shipping Triton configuration, default two-step mode",
    "sessions_per_gpu_multiple": 56,
    "gpu_cost_per_session_reduction_percent": 98.2,
    "gpu_cost_assumption": "Equal H100-hour price and utilization; cost per session is inversely proportional to real-time density.",
    "p99_reduction_percent_at_reference_eight_session_maximum": "53–58",
    "p99_comparison": ".wave at 56 sessions: 147.4–147.5 ms; reference NIM at its configured eight-session maximum: 317–351 ms. This is not a matched-concurrency comparison."
  },
  "measured_points": [
    {
      "engine": ".wave",
      "sessions": 48,
      "p99_ms": "139.9–140.0",
      "late_beats": "0 / 72,000",
      "runs": 3
    },
    {
      "engine": ".wave",
      "sessions": 56,
      "p99_ms": "147.4–147.5",
      "late_beats": "0 / 84,000",
      "runs": 3
    },
    {
      "engine": "Reference NIM stack, two-step",
      "sessions": 1,
      "p99_ms": "142–143",
      "late_beats": "1 / 1,500",
      "runs": 3
    },
    {
      "engine": "Reference NIM stack, two-step",
      "sessions": 2,
      "p99_ms": "172–176",
      "late_beats": "8–15%",
      "runs": 3
    },
    {
      "engine": "Reference NIM stack, two-step",
      "sessions": 4,
      "p99_ms": "186–188",
      "late_beats": "26–39%",
      "runs": 3
    },
    {
      "engine": "Reference NIM stack, two-step",
      "sessions": 8,
      "p99_ms": "317–351",
      "late_beats": "most",
      "runs": 3
    }
  ],
  "evidence": {
    "article": "../../technical-notes/wpk-persistent-kernel/",
    "model_source": "https://huggingface.co/nvidia/NVIDIA-NemotronLabs-VoiceChat-11B",
    "study_period": "September 2026"
  }
}
