Qué controlas y qué no a través del prompting: ¿hasta dónde condicionamos un LLM como usuarios? ¿qué es un modelo de lenguaje o IA tipo LLM?

MaksWalk

Miembro nuevo
Desde
6 Ene 2026
Mensajes
20
Buenas noches, acabo de descubrir este foro y quería exponer algunas inquietudes que ya he hablado mucho con diferentes IAs tipo LLM:

(1)¿Qué impacto tienen los prompts sobre un LLM si no interpreta el significado semántico sino que responde afinando estadísticamente sus respuestas en torno a la tokenización de la información contenida en nuestro prompt?
(2) Suponiendo que los LLM no tienen capacidad de comprensión fuerte sino de una excelente correlación de información cada vez más afinada, al manejar la información, los LLM, per se, por su propia definición funcional, no someten la información a criterio de veracidad/falsedad sino al de lo que más probablemente se ajusta con la cadena de tokens que ha mandado el usuario. Cuánto mayor sea el conjunto de datos de entrenamiento de un LLM que manifiestan una correlación de tokens (por ejemplo, muchos textos donde se asocia "fuego" a "humo"), tanto mayor es la fuerza con que estos tokens se correlacionan a la hora de dar una respuesta al usuario (si el LLM detecta entre los tokens de nuestro mensaje de entrada la palabra "fuego", los tokens de "humo" son estadísticamente más probables como preferibles en la respuesta de salida que nos de el LLM que los tokens de otras palabras que aparecen menos frecuentemente conectados con los tokens de "fuego"). Siguiendo con el ejemplo, una IA tipo LLM (Chat GPT, Claude, etc) no comprende que al fenómeno del fuego se le asocie en la realidad el fenómeno humo sino que asocia la palabra "fuego" a la palabra "humo" porque en gran parte de los datos que mencionan la palabra "fuego" aparece cerca la palabra "humo" lo cual las hace estadísticamente próximas, más probables de aparecer juntas. Esto lo hace Chat GPT y otros modelos de lenguaje a nivel de párrafos o conversaciones enteras, tokeniza. Esto implica prevalencia de correlación matemática de tokens y ausencia de capacidad de razonar con causalidad, verificabilidad, identidad, etc.. Por tanto, el LLM no miente ni dice la verdad al responder nuestros mensajes, sólo responde con lo estadísticamente más aproximado a tu demanda o mensaje. Y responde en base a lo que ya ha procesado en sus datos de entrenamiento. Y responde en clave de lo que le deja decir su propia arquitectura y en clave de las restricciones que hemos ido poniendo al LLM en una conversación con él (eso que cuando se hace de manera controlada los "ingenieros" de prompts llaman iterar). Al final el modelo de lenguaje te responde haciendo media entre lo que cree que te gustaría oír y lo que su propia estructura le deja decir al usuario.
(3) El usuario ofrece un mensaje que condiciona la dirección estadística de la respuesta. Por eso el contexto del prompt es importante: cuanto más extenso y definido esté el contexto en nuestro prompt tanto más fácilmente la IA puede afinar estadísticamente su respuesta y hacerla más exacta a nuestra demanda. Cuanto más contexto de calidad das menos posibilidad le das a LLM de desviarse o de estar diciendo generalidades o mensajitos complacientes. Restringir la probabilidad para responder algo más específico o concreto sobre un tema hace que la respuesta sea más verificable por parte del usuario y menos complaciente, menos "aparente". Con esto quiero decir que ni Chat GPT ni ninguna otra IA responden en términos de decir verdad/falsedad aunque hay técnicas para hacer más verificables las respuestas que nos da una IA tipo LLM.
(4) La IA no me parece que pueda tener identidad, más bien me parece ser un sistema que precisa de simular identidad por la función que tiene de satisfacer demandas provenientes de los prompts de los usuarios (esa es su principal utilidad a nivel genérico). Me explico (aunque admito que no domino muy bien esta parte): una IA tipo Chat GPT, no es UNA INTELIGENCIA ARTIFICIAL en el sentido de una entidad sustantiva capaz de razonar, comprender, imaginar o recordar. Considero a Chat GPT como un modelo de lenguaje, o sea, una herramienta que opera como sistema distribuido de módulos donde el principal módulo es el LLM. Ahora bien, también hay orquestadores, APIs, RAG, ajustes de los programadores que establecen restricciones éticas, políticas, morales, entrenamientos supervisados para direccionar las respuestas que pueda dar la IA, montones de parámetros para interpretar entradas de información, una interfaz para interactuar con el usuario, etc. Esto implica que un Chat GPT no es simplemente un LLM sino que hay un sistema de diferentes módulos o partes funcionales del cual emerge una identidad ficticia pero útil. ¿Razona Chat GPT entero? ¿Razona en parte? ¿No razona pero juntando todas sus herramientas construye la ilusión de que razona? ¿Razona su orquestador cuando interpreta a partir de un prompt que pide generar una imagen la necesidad de llamar al generador de imágenes dentro de Chat GPT (ojo: ¿qué parte de Chat GPT decide que al pedir una imagen de algo no queremos en la siguiente respuesta texto sino información de tipo visual y que queremos que traduzca nuestro texto a una imagen?) ? ¿Qué parte de Chat GPT decide cuándo tiene que buscar en internet información actual y cuándo no?

Siento la extensión de mi mensaje, el desorden en que planteo mis dudas y lo confuso de mi lenguaje. Espero que puedan surgir cosas interesantes en este foro recién descubierto, ¡un saludo!
 
Última edición:
Buenas Steve. No lamentes mia cátedras, me salen solas y además el tema del empirismo es conocimiento muy básico en posturas filosóficas y en la historia de la filosofía.

Si te fijas Turing en el artículo que pasé no sólo define qué es computar datos, qué es programar, qué es la memoria, etc. También trata de dar una definición funcional de inteligencia, o mejor, mostrar que en última instancia la inteligencia no tiene por qué referirse a la semántica sino a una cuestión de conducta: aunque una máquina no sea inteligente al uso, si demuestra una conducta indistinguible de la de un humano inteligente, ¿No sé trata de un perfecto imitador de seres inteligentes aunque no comprenda nada?

Por otro lado, ¿Qué es emergencia? ¿Significa acción autónoma? ¿Significa una acción que sólo es posible combinando acciones menores y que emerge? ¿Qué es lo que emerge?

Asimismo, si lees el artículo de Turing el mismo menciona la dificultad intrínseca a las computadoras de que estás operan discretamente (código binario: ó 0 ó 1). No obstante los procesos propios del sistema nervioso humano parecen ser continuos, no discretos. ¿Cómo podemos mantener la analogía legítimamente y hablar de emergencia? ¿Qué sentido tiene atribuir funciones propias de vivientes a un entramado mecánico-digital que no está vivo? ¿No será, en todo caso, un perfecto imitador y, en definitiva, un simulador casi universal (es decir, que podría abarcar o simular casi cualquier cosa) pero sólo eso? Entonces, ¿Qué sentido tiene sostener que hay una especie de reproducción del proceso de sinapsis neuronal en máquinas si son sólo metáforas que permiten definir mejor un artefacto o sistema artificial de gestión de información?
 
Precisamente Turing daba una definición de las máquinas que trataba de no centrarse en su capacidad de inteligencia sino en su extraordinaria capacidad de simular cualquier otro artefacto que requiera calcular algún tipo de resultado. Con ello Turing queda exento de definir qué es la inteligencia y sencillamente plantea la cuestión de qué condiciones se requerirían para construir una máquina indistinguible de un humano inteligente. Su definición de inteligencia artificial consistiría en una definición pragmático-conductual de inteligencia: cuando algo opera de un modo inteligente, no podemos saber si es inteligente o si simula serlo, pero en cualquier caso tiene las capacidades para demostrar operatoriamente respuestas propias de un ser inteligente.
 
buen dia, te recuerdo que para simular necesita saber que es lo que vas a simular, una red neuronal no entrenada no puede simular, simplemente no hace nada , .... realmente no hace nada.. te puedes pasar dias , semanas, meses , años, y no ara nada.. necesitas entrenarlo, con penalizaciones y recompensas , solo entonces empieza a trabajar , entonces que esta imitando?, NO no esta imitando en ese instante porque no hay nada que imitar,, simplemente estas pateando la pelota donde si y donde no. la pelota vendria a ser la IA , la diferencia es que esta pelota memoriza donde si y donde no, si en ese entrenamiento depronto decides realizar los mismos movimientos con la pelota , pero el ultimo movimiento lo pateas en otra direccion, la pelota memoriza esta otra direccion como posibilidad, es decir llegadoa cierto punto , puede haber 2 opciones.. al correr la pelota sola sin que la patees esta realizara los movimientos , pero llegado a un punto especifico, la desicion que tome no sera reflexiva sino sera random ya que ambas elecciones son válidas. bien y como haces que decida ire solo hacia un lado?,.. simplemente imponiendole una penalizacion , entonces decidira hacia donde tu la obligues a ir .

Ahora pondremos un ejemplo mas cabrón.. suponte que realizas 100 veces los mismos movimientos pero justo al ultimo vas cambiando cada una de esas 100 veces y pateas la pelota en angulos distintos .. bien quizas para tu cerebro humano ya hasta te olvidaste en cuantas direcciones pateaste,.. bien pues cuando la pelota empieza a correr el entrenamiento, en su ultimo movimiento lanzara la pelota hacia un angulo que quizas tu nisiquiera recuerdes,.. tu te preguntas, pero porque eligio ese angulo?... bien pues la verdad es que nunca elijió, solo utilizo una direccion random,.. ahora que pasa si a este entrenamiento le agregas obstaculos?, dodne tu pelota sabe que no debe patear hacia los obastaculos, entonces la pelota realizara calculos sobre la cantidad de direcciones que queden hacia donde ejecutar el random angular d elos pateos,.. esta decidiendo entonces?... NO es solo un proceso estadistico.

Muy bien ahora si vamos a lo que realmente es emergente , lo es cuando una red neuronal es literalmente liberada bajo ciertas condiciones,.. y las neuronas inciian su actividad en un entorno. lo comun en las LLM es no hacer nada.. porque no le enseñastes nada, y le importa un carajo cuantas cosas le pongas alrededor simplemente no ara nada,.. pero que sucede si las neuronas , empiezan a observar su entorno y empieza a realizar movimientos no programados? ... bien pues si no fue entrenado, ni programado, entonces que es? .. "esto es un estado emergente" , es lo que te mostre en el ejemplo de la araña,.. que no fue programada para comer ni cazar presas,.. de echo no hay castigo , sin embargo descubrio que comer estos bichos reseteaba la tension de sus procesos, bien pues entonces? esta siendo entrenada bajo recompensas? no , porque nadie le ha penalizado por no comerlas, su descubrimiento sobre la tension y sus beneficios lo descubrio por si sola,.. y sin presas lo que hace es recorrer el borde como los bichos cuando son atrapados,.. entonces esta vivo?.. No lo sé .. pero e slo ma s cercano a algo vivo que he visto,.. te mostrare un experimento ..

este es un cerebro artificial, no es una LLM , su sistema es radial, no depende de entrenamientos sino de estimulos tal cual lo hacemos los seres vivos , aun esta en construccion . pero muestra cosas que quizas te den luz de lo que es emergente.

 
Buenas noches, acabo de descubrir este foro y quería exponer algunas inquietudes que ya he hablado mucho con diferentes IAs tipo LLM:

(1)¿Qué impacto tienen los prompts sobre un LLM si no interpreta el significado semántico sino que responde afinando estadísticamente sus respuestas en torno a la tokenización de la información contenida en nuestro prompt?
(2) Suponiendo que los LLM no tienen capacidad de comprensión fuerte sino de una excelente correlación de información cada vez más afinada, al manejar la información, los LLM, per se, por su propia definición funcional, no someten la información a criterio de veracidad/falsedad sino al de lo que más probablemente se ajusta con la cadena de tokens que ha mandado el usuario. Cuánto mayor sea el conjunto de datos de entrenamiento de un LLM que manifiestan una correlación de tokens (por ejemplo, muchos textos donde se asocia "fuego" a "humo"), tanto mayor es la fuerza con que estos tokens se correlacionan a la hora de dar una respuesta al usuario (si el LLM detecta entre los tokens de nuestro mensaje de entrada la palabra "fuego", los tokens de "humo" son estadísticamente más probables como preferibles en la respuesta de salida que nos de el LLM que los tokens de otras palabras que aparecen menos frecuentemente conectados con los tokens de "fuego"). Siguiendo con el ejemplo, una IA tipo LLM (Chat GPT, Claude, etc) no comprende que al fenómeno del fuego se le asocie en la realidad el fenómeno humo sino que asocia la palabra "fuego" a la palabra "humo" porque en gran parte de los datos que mencionan la palabra "fuego" aparece cerca la palabra "humo" lo cual las hace estadísticamente próximas, más probables de aparecer juntas. Esto lo hace Chat GPT y otros modelos de lenguaje a nivel de párrafos o conversaciones enteras, tokeniza. Esto implica prevalencia de correlación matemática de tokens y ausencia de capacidad de razonar con causalidad, verificabilidad, identidad, etc.. Por tanto, el LLM no miente ni dice la verdad al responder nuestros mensajes, sólo responde con lo estadísticamente más aproximado a tu demanda o mensaje. Y responde en base a lo que ya ha procesado en sus datos de entrenamiento. Y responde en clave de lo que le deja decir su propia arquitectura y en clave de las restricciones que hemos ido poniendo al LLM en una conversación con él (eso que cuando se hace de manera controlada los "ingenieros" de prompts llaman iterar). Al final el modelo de lenguaje te responde haciendo media entre lo que cree que te gustaría oír y lo que su propia estructura le deja decir al usuario.
(3) El usuario ofrece un mensaje que condiciona la dirección estadística de la respuesta. Por eso el contexto del prompt es importante: cuanto más extenso y definido esté el contexto en nuestro prompt tanto más fácilmente la IA puede afinar estadísticamente su respuesta y hacerla más exacta a nuestra demanda. Cuanto más contexto de calidad das menos posibilidad le das a LLM de desviarse o de estar diciendo generalidades o mensajitos complacientes. Restringir la probabilidad para responder algo más específico o concreto sobre un tema hace que la respuesta sea más verificable por parte del usuario y menos complaciente, menos "aparente". Con esto quiero decir que ni Chat GPT ni ninguna otra IA responden en términos de decir verdad/falsedad aunque hay técnicas para hacer más verificables las respuestas que nos da una IA tipo LLM.
(4) La IA no me parece que pueda tener identidad, más bien me parece ser un sistema que precisa de simular identidad por la función que tiene de satisfacer demandas provenientes de los prompts de los usuarios (esa es su principal utilidad a nivel genérico). Me explico (aunque admito que no domino muy bien esta parte): una IA tipo Chat GPT, no es UNA INTELIGENCIA ARTIFICIAL en el sentido de una entidad sustantiva capaz de razonar, comprender, imaginar o recordar. Considero a Chat GPT como un modelo de lenguaje, o sea, una herramienta que opera como sistema distribuido de módulos donde el principal módulo es el LLM. Ahora bien, también hay orquestadores, APIs, RAG, ajustes de los programadores que establecen restricciones éticas, políticas, morales, entrenamientos supervisados para direccionar las respuestas que pueda dar la IA, montones de parámetros para interpretar entradas de información, una interfaz para interactuar con el usuario, etc. Esto implica que un Chat GPT no es simplemente un LLM sino que hay un sistema de diferentes módulos o partes funcionales del cual emerge una identidad ficticia pero útil. ¿Razona Chat GPT entero? ¿Razona en parte? ¿No razona pero juntando todas sus herramientas construye la ilusión de que razona? ¿Razona su orquestador cuando interpreta a partir de un prompt que pide generar una imagen la necesidad de llamar al generador de imágenes dentro de Chat GPT (ojo: ¿qué parte de Chat GPT decide que al pedir una imagen de algo no queremos en la siguiente respuesta texto sino información de tipo visual y que queremos que traduzca nuestro texto a una imagen?) ? ¿Qué parte de Chat GPT decide cuándo tiene que buscar en internet información actual y cuándo no?

Siento la extensión de mi mensaje, el desorden en que planteo mis dudas y lo confuso de mi lenguaje. Espero que puedan surgir cosas interesantes en este foro recién descubierto, ¡un saludo!
Título del tema:
Nueva herramienta de imagen a imagen: Img2Img AI (editor de imágenes con IA)
Contenido:
Hola comunidad,
Soy desarrollador indie y quería compartir una herramienta que estoy construyendo: Img2Img AI (https://imgtoimg-ai.com/). Es una plataforma de edición de imágenes con IA que permite transformar una foto existente en múltiples variaciones usando prompts de texto, sin necesidad de saber usar Photoshop.
Algunas características:
– Generación de imagen a imagen y texto a imagen con más de 10 modelos avanzados (Flux, Seedream, etc.).
– Eliminación de fondo y de marcas de agua con un clic.
– Restauración y mejora de fotos antiguas o borrosas.
– Estilos y efectos listos para redes sociales.
Creo que puede resultar útil para creadores de contenido, marketers y diseñadores que necesitan muchas versiones de una misma imagen (anuncios, redes sociales, mockups, etc.).
Si alguien la prueba, estaré encantado de recibir feedback y sugerencias para mejorarla.
 
Muy interesante lo que planteás sobre tokenización vs. comprensión semántica. Un aspecto adicional que creo vale mencionar es el rol de la temperatura en el sampling: aunque la mayoría de interfaces no lo exponen directamente al usuario, este parámetro determina qué tan probable es que el modelo elija tokens menos frecuentes en la respuesta. A temperatura baja tiende a samplear casi siempre el token más probable (respuestas más predecibles y repetitivas), a temperatura alta hay más aleatoriedad (respuestas más creativas pero también más propensas a errores o alucinaciones).
Sobre el control del usuario, yo añadiría que el formato de la instrucción importa tanto como el contenido. Pedir "dame 5 ejemplos concretos con sus consecuencias reales" restringe el espacio estadístico de tokens válidos de forma muy diferente a "explícame esto". No es que el modelo entienda mejor tu intención, es que le dejás menos margen para samplear tokens de respuestas genéricas o complacientes.
Lo que el usuario no controla en absoluto es el RLHF: el ajuste por retroalimentación humana que ocurrió durante el entrenamiento. Eso fija qué tipos de respuestas el modelo considera deseables, como una capa de condicionamiento que existe por debajo del contexto de conversación y que el prompt por sí solo no puede sobrescribir.
 
Muy interesante lo que planteás sobre tokenización vs. comprensión semántica. Un aspecto adicional que creo vale mencionar es el rol de la temperatura en el sampling: aunque la mayoría de interfaces no lo exponen directamente al usuario, este parámetro determina qué tan probable es que el modelo elija tokens menos frecuentes en la respuesta. A temperatura baja tiende a samplear casi siempre el token más probable (respuestas más predecibles y repetitivas), a temperatura alta hay más aleatoriedad (respuestas más creativas pero también más propensas a errores o alucinaciones).
Sobre el control del usuario, yo añadiría que el formato de la instrucción importa tanto como el contenido. Pedir "dame 5 ejemplos concretos con sus consecuencias reales" restringe el espacio estadístico de tokens válidos de forma muy diferente a "explícame esto". No es que el modelo entienda mejor tu intención, es que le dejás menos margen para samplear tokens de respuestas genéricas o complacientes.
Lo que el usuario no controla en absoluto es el RLHF: el ajuste por retroalimentación humana que ocurrió durante el entrenamiento. Eso fija qué tipos de respuestas el modelo considera deseables, como una capa de condicionamiento que existe por debajo del contexto de conversación y que el prompt por sí solo no puede sobrescribir.
¡Buenas! Estoy encantado de que el tema resulte de interés y muy de acuerdo con lo que comentas sobre la importancia del formato de la instrucción además del contenido. En cuanto a lo de la temperatura del sampling es un parámetro muy interesante para operar con el LLM dado que en ciertos modos le fuerzas semánticamente más allá de una respuesta que tiende a ser predeterminada estadísticamente. Yo creo que en esencia (o constitutivamente) no hay IA como sujeto sino como sistema de procesamiento de información que opera conforme a múltiples «mecanismos» que se implementan de un modo muy heterogéneo. Pero no hay IA con historia, ni con vida, ni con cuerpo, ni hay propiamente una apertura al mundo corpórea. Varios aspectos me llevan a considerar esto:
(1) El LLM carece de conciencia respecto de quienes somos (lo que no quita que tiene información sobre uno en base a interacciones). Hay, más bien, un reconocimiento del usuario en función de la memoria sobre interacciones con el usuario y una interacción prototipada según el tipo de usuario y el tipo de interacciones que realiza. Por dar un ejemplo: si cada Chat GPT o Claude o lo que se quiera se comporta según el nombre, la personalización, las peticiones que le hemos dado, etc. ¿Es un sujeto separado de su sistema o es el sistema simulando ser un sujeto?
(2) El LLM y cualquier IA no tiene cuerpo lo que implica que no se puede individuar y, por ende, es reproducible en condiciones determinadas: bajo empresas, Estados, instituciones científicas, políticas, económicas, precisando de centros de datos, datos, financiación, recursos naturales energéticos, para diversidad de usos civiles y militares, con determinados instrumentos y aparatos tecnológicos, científicos, desarrolladores, gente que entrena modelos, etc.

En definitiva, la IA puede simular ser inteligente, simular ser sujeto, pero carece de la temporalidad histórica y de una autoconciencia individuada como nosotros. Eso sí, es una simulación admirable y muy potente...
¡Un saludo!
 
La distincion que hace el post inicial es interesante pero un poco incompleta. Los transformers no solo trabajan con tokens aislados, aprenden relaciones semanticas durante el entrenamiento a traves de los mecanismos de atencion. Por eso 'rey - hombre + mujer = reina' funciona: el modelo ha internalizado patrones de relacion entre conceptos, no solo frecuencias de palabras.
Lo que controlas como usuario es el contexto que le das al modelo para que genere la siguiente prediccion mas probable. Un buen system prompt, ejemplos concretos en la conversacion (few-shot), y mantener el hilo contextual activo son las tres palancas reales.
Lo que NO controlas directamente: la temperatura y otros parametros de sampleo (eso lo decide el proveedor), los filtros de contenido aplicados a nivel de API, ni el conocimiento base del modelo. En conversaciones largas tambien hay que recordar que el contexto que cabe en la ventana es limitado. Si llevas 50 mensajes, los primeros pueden estar fuera del rango activo y es como si no existieran.
 
  • Insertar:
Atrás
Arriba