Rozcestník k inference serverům a runtimeům, které načítají lokální model, spravují paměť GPU a zpřístupňují jej aplikacím přes API.
Runtime pro lokální AI