Mensaje de IA de ME. Los equipos de ciencia de datos suelen moverse entre herramientas independientes para acceder a datos gobernados, análisis de R, desarrollo de modelos en Python, despliegue, desarrollo de aplicaciones e informes. Positron, el entorno de desarrollo integrado (IDE) de Posit para ciencia de datos, ahora se ejecuta en Amazon SageMaker AI. Para un científico de datos, ejecutar Positron en SageMaker AI significa: acceso a los datos sin gestionar credenciales. Positron se ejecuta bajo el rol de ejecución de Space, por lo que puedes consultar Amazon Athena, AWS Glue Data Catalog y Amazon Simple Storage Service (Amazon S3) directamente desde el IDE. El acceso sigue los permisos del rol, sin claves que almacenar o rotar. El cómputo está listo cuando tú lo estás. Lanzas un Space con el tamaño de instancia que necesitas, y los equipos pueden reservar capacidad con los planes de entrenamiento de SageMaker AI para que el cómputo esté disponible para entrenamientos programados. Asistencia de IA que permanece dentro de tu cuenta. Posit Assistant, el asistente de codificación con IA de Posit, puede usar Amazon Bedrock como proveedor de modelos, de modo que la ayuda de IA se ejecuta en modelos dentro de tu propia cuenta de AWS y de tu Región de AWS. Espacio para trabajar en paralelo y en conjunto. Puedes ejecutar varios Spaces a la vez para proyectos independientes y usar un Space compartido para que varias personas colaboren en la misma aplicación de Positron. Posit publica una definición de imagen de contenedor para Positron, basada en la imagen de Amazon SageMaker Distribution. Los administradores de la plataforma construyen esa imagen, la envían a su propio repositorio de Amazon Elastic Container Registry (Amazon ECR), la registran con SageMaker AI y la adjuntan a un dominio de Studio. Luego, los científicos de datos eligen Positron al crear un Space y abren el IDE directamente en Studio. Esta publicación muestra cómo un científico de datos experimenta Positron en SageMaker AI, desde explorar una tabla de Amazon Athena hasta desplegar un endpoint en tiempo real. Figura 1. Entorno de desarrollo integrado (IDE) de Positron en Amazon SageMaker Studio. Descripción general de la solución Este recorrido usa una cartera sintética de 50.000 préstamos. Amazon S3 almacena los datos de origen y AWS Glue Data Catalog los registra. Amazon Athena consulta los datos, R valida las características y Python entrena un clasificador XGBoost. Shiny para Python invoca el endpoint y Quarto registra el flujo de trabajo. Las capturas de pantalla y las métricas provienen de la ejecución capturada. Los datos no representan un sistema de préstamos en producción. Requisitos Para seguir este recorrido, una organización necesita: Una concesión de licencia de Posit y acceso a la definición de imagen de Positron publicada por Posit. Permisos de administrador para administrar Amazon ECR y configurar imágenes personalizadas para el dominio de Amazon SageMaker Studio. Un rol de ejecución de Space con acceso a Amazon Athena y AWS Glue Data Catalog. Una ubicación de origen en Amazon S3 y una ubicación de resultados de consulta de Athena configurada. Acceso a modelos de Amazon Bedrock en la misma Región de AWS que el dominio de Studio cuando se usa Posit Assistant, el asistente de codificación con IA de Posit. Una instancia ml.t3.xlarge o superior para el entorno demostrado. Figura 2. Un proyecto conecta datos gobernados de AWS, análisis de R y Python, un servicio administrado de hosting, una aplicación y un informe reproducible. Paso 1: Positron en un Space de SageMaker Studio La ejecución comenzó con Positron en un Space de SageMaker Studio. El explorador de proyectos, el editor, las sesiones de R y Python, el panel Variables, gráficos, el terminal y la vista previa de la aplicación estuvieron disponibles en un entorno basado en navegador en el cómputo de SageMaker bajo el rol de ejecución de Space. Figura 3. Un Space de JupyterLab configurado para ejecutar la imagen personalizada de Positron. Paso 2: Descubrimiento de datos gobernados con Posit Assistant Desde el mismo Space, Posit Assistant identificó credit_risk_blog.loan_tape_source en AWS Glue Data Catalog y preparó una consulta de Amazon Athena de solo lectura. La consulta devolvió cinco filas de ejemplo en seis campos, escaneó 2,18 MiB y se completó en menos de un segundo. Figura 4. Posit Assistant usando el entorno de Athena configurado para inspeccionar el origen gobernado. 2.1: Uso de token y caché de Amazon Bedrock Posit Assistant puede usar Amazon Bedrock como proveedor de modelos con credenciales de AWS y una Región de AWS configurada. No se requiere una clave de API separada para el proveedor de modelos cuando la autenticación de Amazon Bedrock se resuelve mediante las credenciales de AWS del entorno. El contenido del cliente se cifra, no se usa para mejorar modelos base y no se comparte con proveedores de modelos (consulta la protección de datos de Amazon Bedrock). Se puede configurar conectividad privada con AWS PrivateLink. La vista de información de la Sesión capturada registró 6.657.942 tokens, incluyendo 6.118.411 tokens de lectura de caché y 462.905 tokens de escritura de caché, con un costo estimado de $6.319 y 92,5 por ciento de eficiencia de caché, como se muestra en la figura siguiente. Esos valores describen esta sesión y la estimación del asistente. No son una factura de AWS ni un punto de referencia general de costos. El comportamiento de la caché y la fijación de precios dependen del modelo y el proveedor seleccionados. Figura 5. Vista de información de la Sesión para la sesión del asistente registrada. Paso 3: Perfilado de datos en Amazon Athena El flujo de trabajo usó una consulta agregada de Athena para examinar recuentos de filas, unicidad de identificadores, valores faltantes, rangos numéricos y validez del objetivo. Los resultados identificaron 50.000 préstamos, incluidos 1.500 registros con ingresos faltantes y 1.015 valores por defecto, para una tasa global de default del 2,03 por ciento. Figura 6. El punto de control de aprobación antes de que Posit Assistant ejecute el comando de perfilado. Figura 7. El perfilado de la fuente de 50.000 filas antes del desarrollo del modelo. Paso 4: Exploración interactiva de datos en R El flujo de trabajo cargó la tabla de 50.000 filas en la sesión activa de R y la abrió en Data Explorer. R creó características de deuda-ingreso y log-ingreso y mostró la distribución de deuda-ingreso en el panel Plots. Al excluir los 1.500 registros incompletos, quedaron 48.500 préstamos para el modelado y la puntuación. Figura 8. Inspección de los datos de origen y validación de variables derivadas en R. Paso 5: Validación de características y entrenamiento de modelo en Python Las definiciones de características validadas se movieron luego a Python. Un clasificador XGBoost entrenado en una matriz que contenía 40.000 filas y tres características del modelo. La evaluación retenida produjo un AUC de 0,834 y mostró una tasa observada de default del 12,3 por ciento en el decil de mayor riesgo. Figura 9. Evaluación del modelo con un AUC retenido de 0,834 y tasas observadas de default por decil de riesgo. Paso 6: Despliegue administrado con SageMaker AI El flujo de trabajo escribió las probabilidades predichas y los deciles de riesgo para 48.500 préstamos en Parquet y registró los resultados como credit_risk_blog.scored_loans en Athena. Después, creó un modelo de SageMaker AI, una configuración de endpoint y un endpoint en tiempo real. El endpoint alcanzó InService y una invocación usando una carga útil sintética de solicitante tuvo éxito. Figura 10. El endpoint de SageMaker AI en tiempo real en servicio. Paso 7: Inferencia en vivo con una aplicación Shiny para Python El proyecto usó una aplicación Shiny para Python para invocar el endpoint desplegado. La aplicación aceptó información sintética del solicitante, aplicó las definiciones de características usadas durante el entrenamiento y mostró la probabilidad devuelta de default. El código fuente y la aplicación en ejecución permanecieron en el mismo proyecto de Positron, que se ejecuta detrás del proxy de la aplicación de Amazon SageMaker Studio y solo es accesible por usuarios autenticados en el Space. Invoca el endpoint bajo el rol de ejecución de Space, en lugar de cualquier clave almacenada, y el rol se limita a sagemaker:InvokeEndpoint en el ARN del endpoint. Figura 11. Una aplicación Shiny para Python invocando el endpoint en vivo de SageMaker AI. Paso 8: Informes reproducibles con Quarto La ejecución concluyó con un informe de Quarto que conectó la fuente de Athena, los hallazgos de calidad de datos, la validación de R, el modelo de Python, la salida puntuación, el endpoint de SageMaker AI y la aplicación Shiny. El informe se generó directamente a partir del proyecto, conservando la evidencia y los resultados del flujo de trabajo en un único documento reproducible. Figura 12. Quarto preservando la evidencia y las decisiones del flujo de trabajo. Arquitectura de despliegue El despliegue implica dos rutas: una ruta de administrador que construye y registra la imagen personalizada de Positron, y una ruta de ciencia de datos que la usa para analizar datos y desplegar modelos. Ruta de administración Positron se ejecuta como una imagen personalizada construida sobre la imagen de Amazon SageMaker Distribution en SageMaker AI. Un administrador construye la definición de imagen publicada por Posit, la envía a un repositorio privado de Amazon Elastic Container Registry (Amazon ECR) en la Región de AWS del dominio de Studio, registra una imagen y una versión de SageMaker AI, crea una configuración de imagen de una app de JupyterLab, verifica licencias, concede al rol de ejecución los permisos requeridos y adjunta la imagen al dominio. Posit publica la definición de la imagen, por ejemplo el Positron SageMaker Containerfile, que se basa en la imagen base de SageMaker Distribution. Amazon Bedrock es opcional y solo se usa cuando se selecciona como proveedor de Posit Assistant. Las responsabilidades permanecen separadas. Posit proporciona la imagen de software y el soporte del producto. El cliente gestiona identidad, permisos, licencias, redes, registro (logging), actualizaciones de imágenes y servicios de AWS aprobados. AWS opera los servicios cloud administrados. Ruta de ciencia de datos El científico de datos inicia JupyterLab en un Space de SageMaker Studio, abre Positron y usa R, Python, Quarto, Posit Database Drivers y, opcionalmente, Posit Assistant para consultar y analizar datos y desplegar modelos. Figura 13. Configuración del administrador y responsabilidades del científico de datos para el Space de Positron. Lo que estableció la ejecución registrada El flujo de trabajo registrado demostró las siguientes capacidades dentro de un único Space de Positron: Acceso a datos gobernados. El descubrimiento, muestreo y perfilado de Athena se ejecutaron desde el Space configurado. Análisis entre lenguajes. R validó los datos y las características antes de que Python entrenara el modelo. Comportamiento del modelo medido. El AUC retenido fue 0,834 y el decil de mayor riesgo tuvo una tasa observada de default del 12,3 por ciento. Despliegue administrado. El flujo de trabajo registró 48.500 filas puntuadas en Athena y llevó un endpoint en tiempo real a InService. Salidas conectadas. La aplicación Shiny en vivo y el informe de Quarto se produjeron a partir del mismo proyecto. Alcance y limitaciones Los conjuntos de datos y las cargas útiles del solicitante eran sintéticos. El flujo de trabajo no estableció equidad del modelo, calibración, idoneidad crediticia para préstamos, latencia en producción, comportamiento de carga, monitoreo ni cumplimiento normativo. Los resultados del AUC y los deciles provienen de una sola partición retenida, y los deciles inferiores no fueron estrictamente monótonos. Las capturas de pantalla documentan una sola ejecución registrada y no deberían presentarse como un punto de referencia general de desempeño o costos. La adopción en producción también requiere validar los términos de la vista previa de Posit, la concesión de licencia y la versión de la imagen junto con las Regiones de AWS compatibles y la disponibilidad de modelos. Los equipos también deben confirmar el diseño de red, los permisos de mínimo privilegio, el manejo de secretos, el logging, el parcheo de imágenes y la responsabilidad operativa. Limpieza Para evitar cargos continuos, elimina los recursos que creó este recorrido. Elimínalos en el siguiente orden, porque el endpoint en tiempo real depende tanto de su configuración de endpoint como de su modelo: primero elimina el endpoint, luego la configuración del endpoint y después el modelo. Elimina el endpoint de inferencia en tiempo real. En la consola de SageMaker AI, ve a Inference > Endpoints, selecciona tu endpoint y elige Delete. aws sagemaker delete-endpoint --endpoint-name Elimina la configuración del endpoint. Ve a Inference > Endpoint configurations, selecciona tu configuración y elige Delete. aws sagemaker delete-endpoint-config --endpoint-config-name Elimina el modelo. Ve a Inference > Models, selecciona tu modelo y elige Delete. aws sagemaker delete-model --model-name Elimina los objetos de salida de la consulta y elimina la tabla de Athena. En la consola de Amazon S3, abre tu bucket, ve al prefijo de salida, selecciona los objetos y elige Delete. aws s3 rm s3://amzn-s3-demo-bucket// --recursive Luego, en el editor de consultas de la consola de Amazon Athena, ejecuta: DROP TABLE IF EXISTS .; Elimina la versión de imagen de Amazon ECR. En la consola de Amazon ECR, ve a Repositories, selecciona tu repositorio, selecciona la etiqueta de imagen y elige Delete. aws ecr batch-delete-image --repository-name --image-ids imageTag= Elimina el registro de la imagen de SageMaker AI. En la consola de SageMaker AI, ve a Admin configurations > Images, selecciona tu imagen y elige Delete. aws sagemaker delete-image --image-name Detén y elimina los Test Spaces que no estés usando. Haz una copia de seguridad de cualquier archivo de proyecto que necesites y confirma primero el comportamiento de retención de almacenamiento del Space. En SageMaker Studio, ve a Spaces, selecciona el Space y elige Stop. Elimina el Space solo después de haber respaldado sus archivos. Conclusión El flujo de trabajo registrado muestra cómo una imagen personalizada de Positron puede mantener el acceso gobernado a datos de AWS, análisis en R y Python, el despliegue de modelos, el desarrollo de aplicaciones y los informes reproducibles en un solo Space de SageMaker Studio. La continuidad es útil porque la evidencia, el código, el resultado del despliegue y el artefacto de comunicación permanecen conectados. El uso en producción aún depende de los controles de seguridad, gobernanza, validación y operación del cliente. Recursos relacionados Para ver antecedentes relacionados, consulta: Guía de configuración de Positron en SageMaker Ejecuta IDEs interactivos en Amazon EKS con SageMaker AI para activar tus flujos de trabajo de IA Documentación de Amazon SageMaker Studio Guía de usuario de Amazon ECR Imagen Docker de Positron Guía de AWS License Manager Sobre los autores Abhishek Maligehalli Shivalingaiah Abhishek es Partners Solutions Architect en AWS, especializado en construir aplicaciones de Generative AI. Con una gran pasión por usar frameworks de IA agentica para resolver desafíos complejos de negocio, aporta casi una década de experiencia desarrollando soluciones de datos e IA que entregan valor tangible a las empresas. Además de sus labores profesionales, Abhishek es un artista que encuentra alegría en crear retratos de familiares y amigos, expresando su creatividad a través de diversos medios artísticos. SriAakash Mandavilli SriAakash es Software Engineer en el equipo de Amazon SageMaker AI, donde construye productos y experiencias para desarrolladores en Amazon SageMaker Studio. Se enfoca en desarrollar soluciones que simplifican y mejoran la experiencia de desarrollo de machine learning para científicos de datos y desarrolladores. Fuera del trabajo, SriAakash disfruta mantenerse activo con caminatas (hiking), ciclismo (biking) y largas caminatas. Arkaprava De Arkaprava es Gerente de Desarrollo de Software en AWS en el equipo de SageMaker AI. Ha estado en Amazon por más de 10 años y trabaja en mejorar la experiencia del IDE de Amazon SageMaker Studio para desarrolladores de machine learning. Arantza Rodriguez Arantza es Senior Technical Product Manager para Amazon SageMaker AI. Le apasiona construir productos escalables que resuelven problemas reales de los clientes. En AWS, se centra en la experiencia del desarrollador de SageMaker AI Studio, ayudando a científicos de datos de distintas industrias a construir, entrenar y desplegar modelos de IA/ML. Fuera del trabajo, Arantza disfruta viajar, jugar fútbol y cocinar. Sam McIntyre Sam es Senior Partner Development Manager trabajando con GenAI ISVs, construyendo asociaciones estratégicas y soluciones innovadoras para clientes de AWS. Con más de 12 años de experiencia en tecnología cloud y el ecosistema de partners, Sam aporta un profundo conocimiento en AWS Marketplace y colaboración con integradores de sistemas líderes y partners de GenAI. (Fuente: ME)