Actualizado en septiembre de 2026: corregí a quién atribuía el SAM 3 del Living Atlas (lo publicó Eagle Technology, y yo decía Esri). También quité dos errores: que era la versión más reciente (SAM 3.1 salió el 27 de marzo, antes de este post) y que se limitaba a fotos naturales, aunque su propia ficha lo da por bueno en imagen aérea y satelital. Dejé de llamar "cambio de paradigma" a segmentar con una palabra, porque ArcGIS ya lo hacía desde 2024 con Text SAM, y agregué que la herramienta pide la extensión Image Analyst. En la sección de pruebas dejé solo lo que se ve en el video: de la velocidad y de la comparación entre idiomas no quedó registro.
El 30 de marzo de 2026 apareció en ArcGIS Online un DLPK (deep learning package, el formato con el que Esri empaqueta modelos) de SAM 3, y hoy forma parte del Living Atlas. SAM 3 es el Segment Anything Model de Meta que puede segmentar a partir de una frase corta. Ese DLPK lo publicó Eagle Technology, el distribuidor de Esri en Nueva Zelanda. Lo descargas, lo eliges como definición del modelo en Detect Objects Using Deep Learning y listo: no tienes que empaquetar nada.
Más allá de la noticia, lo que me interesa es la mecánica: por dónde le llega esa frase al modelo y en qué se queda corto.
Lo que está pasando por debajo
Un DLPK es un .zip con tres piezas: un .emd (Esri Model Definition), que describe el modelo en JSON; los pesos serializados, y una Python Raster Function (PRF), que orquesta la inferencia. DINOv2 también llega a ArcGIS Pro en un DLPK, para generar embeddings.
La PRF es la pieza que importa: hace de puente entre la cadena de procesamiento de píxeles de ArcGIS y el modelo. Con SAM 3 tiene que recibir algo que SAM 1 y SAM 2 no aceptaban: una instrucción de texto (text prompt).
El text prompt como argumento
Detect Objects Using Deep Learning admite argumentos propios de cada modelo en el parámetro arguments. El DLPK de SAM 3 agrega uno de texto, que en el panel de la herramienta aparece como "Text Prompt", y la PRF se lo entrega al modelo como la condición de qué segmentar. En ese campo puedes escribir varias clases a la vez, separadas por coma.
Así, el mismo modelo segmenta building, tree o car sobre la misma imagen sin reentrenar ni tocar los pesos: basta con cambiar el argumento.
Ojo, no es la primera vez que ArcGIS segmenta con una palabra. Desde 2024 Esri ofrece Text SAM, que encadena Grounding DINO para encontrar el objeto y SAM para recortarlo. SAM 3 es un solo modelo, y según la propia ficha del DLPK entiende un vocabulario mucho más amplio que Text SAM. Para quien entrenaba un modelo por cada clase, el salto sí es grande.
En el video, sin audio: la ficha del DLPK en el Living Atlas y, después, Detect Objects Using Deep Learning corriendo en ArcGIS Pro con ese paquete sobre un ortomosaico del Tintal. El panel muestra el prompt tree, y el mapa, capas de resultados de varias corridas.
Lo que vi al probarlo
- Sobre el Tintal: le pedí
treesobre un ortomosaico de dron, y lo que devolvió es lo que ves en el video. - Idioma del prompt: queda sin medir. Ni la ficha del DLPK ni el repositorio de Meta dicen qué pasa si escribes el prompt en español.
Lo que no resuelve
- No reemplaza un flujo de producción donde cada polígono tiene que salir bien.
- Tampoco quita el criterio territorial: sigue haciendo falta saber qué preguntarle y cómo revisar lo que devuelve.
- Cada tipo de imagen pide su propia validación.
Sobre ese último punto, la ficha del DLPK dice que SAM 3 funciona en imagen aérea, satelital y de calle "a distintas resoluciones", pero no dice desde qué tamaño de píxel deja de servir. Y pide imagen de 8 bits y 3 bandas: una ortofoto de 16 bits o una escena multiespectral tienes que convertirla antes. Por qué el SAM original tropieza con la vista cenital lo conté en Adaptar SAM a imágenes satelitales con LoRA.
Por qué nos importa en LATAM
Montar un pipeline propio de anotación y entrenamiento queda fuera del alcance de muchas alcaldías, ONG y consultoras de la región. SAM 3 con texto posterga ese trabajo y lo vuelve opcional para muchas tareas exploratorias.
Eso sí, hay una condición: Detect Objects Using Deep Learning pide ArcGIS Pro con la extensión Image Analyst. Si no tienes esa licencia, Meta publica el código de SAM 3 en Python para correrlo por fuera de ArcGIS. A cambio, los pesos están en Hugging Face con acceso por solicitud, y el código necesita una GPU compatible con CUDA 12.6 o superior.
Cómo aportar desde la comunidad
El modelo ya está publicado. Lo que falta, y donde sí podemos aportar como GeoAI LATAM, es una capa de evaluación regional:
- Pruebas comparables (benchmarks) sobre ortofotos del IGAC (Colombia), del INEGI (México) y de los institutos geográficos de otros países de la región.
- Medir cuánto cambia el resultado entre un prompt en inglés y su traducción al español.
- Probar categorías locales (asentamientos informales, cultivos, materiales).
- Documentar dónde sirvió y dónde no, con la imagen y el lugar.
Nada de esto existe todavía como evaluación sistemática. Lo más cercano en el roadmap es GeoBenchX, un benchmark regional que sigue en "Explorando", sin fecha. Si ya corriste SAM 3 sobre una ortofoto de tu municipio, me sirve saber qué prompt usaste, sobre qué imagen y dónde falló.
