
Intervista Pythonista · Wednesday · 39 min
Servire AI: inferenza, router semantici e SLM. #82
0:00-39:24
transcript
show notes
Eugenio Petullà, Chief AI Alchemist di Regolo.ai (provider di inferenza EU-based del gruppo Seeweb/DHH), racconta cosa significa davvero servire modelli su larga scala — dall'architettura di inferenza (K8S, vLLM, proxy, gestione utenti) alle sfide di sovranità tecnologica europea. Si parla anche di Small Language Models, router semantici e paper di ricerca su valutazione empirica e capacità dei modelli.
Riferimenti:
- CLEVER (Clinical LLM Evaluation Expert Review): https://pubmed.ncbi.nlm.nih.gov/41343765/
- BRICK (spatial capability routing): https://arxiv.org/abs/2606.13241
links2




