Sume el presupuesto de memoria simultánea
Comience con los procesos que se superponen, no con sus promedios tranquilos. Una hoja de trabajo ilustrativa de 4 GB podría reservar 700 MiB para herramientas del host, 900 MiB para procesos de API, 1,200 MiB para una base de datos, 500 MiB para un worker y 700 MiB para incertidumbre: 4,000 MiB en total. Esto casi consume el perfil nominal y deja poca confianza para una superposición de versiones mayor.
Estime la demanda de CPU a partir del trabajo medido
Mida el tiempo de CPU de una solicitud o trabajo representativo, luego multiplique por la tasa de finalización pico. Por ejemplo, 25 ms de tiempo de CPU × 20 solicitudes por segundo = 500 ms de CPU cada segundo, o 0.5 núcleo en promedio. Repita con un worker realista activo e inspeccione los picos; los promedios ocultan ráfagas, planificación y esperas de base de datos.
Separe las señales de restricción
| Señal observada | Siguiente verificación probable |
|---|---|
| CPU alta con trabajo ejecutable | Perfilar la ruta crítica y luego comparar más CPU. |
| Presión de memoria o terminación de procesos | Reducir la superposición o añadir RAM medida. |
| CPU baja con solicitudes lentas | Inspeccionar la base de datos, el pool y las esperas externas. |
| La antigüedad de la cola aumenta a medida que se añaden workers | Reducir la concurrencia e inspeccionar la dependencia compartida. |
Tome la decisión de recursos
Elija más CPU solo cuando el perfilado muestre contención de cómputo sostenida. Elija más RAM cuando el conjunto de trabajo simultáneo carezca de reserva. Reduzca la concurrencia cuando el trabajo en paralelo perjudique la latencia de la API o la tasa de finalización útil. Registre la medición desencadenante y luego repita la misma carga de trabajo tras cambiar una variable.