Skip to content
Artwork for Intervista Pythonista
Intervista Pythonista · Wednesday · 39 min

Servire AI: inferenza, router semantici e SLM. #82

Eugenio Petullà, Chief AI Alchemist di Regolo.ai (provider di inferenza EU-based del gruppo Seeweb/DHH), racconta cosa significa davvero servire modelli su larga scala — dall'architettura di inferenza (K8S, vLLM, proxy, gestione utenti) alle sfide di sovranità tecnologica europea. Si parla anche di Small Language Models, router semantici e paper di ricerca su valutazione empirica e capacità dei modelli. Riferimenti: CLEVER (Clinical LLM Evaluation Expert Review): https://pubmed.ncbi.nlm.nih.gov/41343765/ BRICK (spatial capability routing): https://arxiv.org/abs/2606.13241

0:00-39:24

transcript

No transcript — this publisher did not publish one.

show notes

Eugenio Petullà, Chief AI Alchemist di Regolo.ai (provider di inferenza EU-based del gruppo Seeweb/DHH), racconta cosa significa davvero servire modelli su larga scala — dall'architettura di inferenza (K8S, vLLM, proxy, gestione utenti) alle sfide di sovranità tecnologica europea. Si parla anche di Small Language Models, router semantici e paper di ricerca su valutazione empirica e capacità dei modelli.

Riferimenti:

links2