BlogIA y tecnología

Cómo los embeddings convierten su catálogo de productos en un radar de licitaciones

26 de julio de 2026 · 7 min de lectura

Imagine a un fabricante de gases medicinales que se pierde la licitación de una planta de oxígeno hospitalaria en un país vecino porque el anuncio nunca dice "planta de oxígeno". Decía "unidad de generación PSA, concentración de 93%, con tren de compresores redundante". Su alerta por palabras clave estaba configurada con "oxígeno" y "gas medicinal". El comprador usó el término de ingeniería. La alerta se quedó muda. La licitación cerró. Un competidor ganó un trabajo que valía más que todo el presupuesto anual de marketing de ese fabricante, y nadie del equipo llegó a ver nunca el anuncio.

Este es el modo de falla silencioso de la búsqueda por palabras clave en la contratación pública. Las palabras con las que usted vende casi nunca son las palabras con las que un comprador escribe una licitación. Los embeddings resuelven esto al emparejar por significado en vez de por letras.

Por qué las alertas por palabras clave siguen perdiéndose sus mejores licitaciones

Los compradores públicos de los grandes portales (TED de la UE, PNCP de Brasil, UNGM de la ONU, la cartera del Banco Mundial y decenas de sistemas nacionales) no escriben para que los proveedores los encuentren. Escriben para ser jurídicamente precisos. El resultado es una brecha de vocabulario que el emparejamiento por palabras clave no puede cruzar:

  • Sinónimos y términos del oficio. "Equipo de movimiento de tierras" frente a "excavadora" frente a un código CPV que usted nunca memorizó.
  • Especificaciones, no productos. Los compradores describen un caudal, un grado de pureza, un rendimiento, una norma (ISO, EN, CE) en lugar de un nombre de producto.
  • Siglas y jerga local. PSA, VSA, BOO, EPC. Cada portal y cada país se apoya en sus propias abreviaturas.
  • Idiomas. Un exportador portugués que revisa anuncios en español, francés e inglés necesita tres listas de palabras clave, mantenidas para siempre.
  • Usted puede parchear esto con listas de palabras clave cada vez más largas. En la práctica esas listas se vuelven inmanejables: demasiado estrechas y pierde las licitaciones escritas con términos de ingeniería, demasiado amplias y se ahoga en ruido de contratos de limpieza irrelevantes. No hay ninguna configuración que acierte en las dos cosas, porque el problema no son las palabras clave. Es que las letras son la unidad de comparación equivocada.

    Qué es realmente un embedding

    Un embedding es una lista de números (un vector) que representa el significado de un texto. Un modelo de embeddings moderno lee "unidad de generación PSA, concentración de 93%" y "planta de oxígeno medicinal" y coloca a ambas casi en el mismo punto de un espacio de muchas dimensiones, porque aprendió, a partir de cantidades enormes de texto, que describen la misma cosa. "Catering de tortas de cumpleaños" aterriza muy lejos.

    Una vez que el texto es un vector, "¿esta licitación es relevante para este producto?" se convierte en una pregunta de geometría: ¿qué tan cerca están los dos vectores? La medida estándar es la similitud del coseno, una puntuación que va aproximadamente de 0 (sin relación) a 1 (esencialmente el mismo significado). No hace falta ninguna palabra clave compartida. El modelo empareja el concepto.

    Ese solo cambio es lo que convierte un catálogo estático en un radar en vivo.

    Del catálogo al radar: cómo funciona el proceso

    La mecánica es menos misteriosa de lo que suena. El flujo tiene cuatro etapas.

    1. Vectorizar su catálogo, una sola vez. Cada línea de producto se vuelve un pasaje descriptivo corto: qué es, qué hace, las especificaciones y normas que cumple, los sectores a los que sirve. Una línea de gases medicinales podría decir "planta de concentración de oxígeno, tecnología PSA, pureza de 93% a 95%, norma de redes EN ISO 7396-1, para hospitales y clínicas". Convertimos cada pasaje en un vector y lo guardamos. Esa es su huella digital, y solo cambia cuando cambia su oferta.

    2. Vectorizar cada licitación entrante. A medida que llegan los anuncios de los portales (TED publica bastante más de medio millón de anuncios al año, así que el volumen es un problema real), cada uno se convierte en vector de la misma manera. Título, objeto, anexos técnicos, códigos CPV: todo alimenta el vector.

    3. Puntuar el encaje. Cada vector de licitación se compara con cada vector de producto mediante similitud del coseno. El producto con la puntuación más alta determina la relevancia de esa licitación para usted. Una licitación que menciona su especificación exacta puntúa alto incluso con cero palabras clave compartidas; un anuncio genérico de catering puntúa bajo aunque contenga la palabra "oxígeno" en una cláusula de primeros auxilios.

    4. Ordenar y aplicar un umbral. Las puntuaciones le permiten ordenar por encaje y cortar la larga cola. En lugar de 4.000 anuncios en bruto, usted ve los 20 que de verdad se parecen a su negocio, ordenados por qué tan bien coinciden.

    La propiedad clave: esto favorece el recall. La licitación de PSA frente a oxígeno que las alertas por palabras clave dejaron pasar aquí puntúa alto, porque el modelo sabe que las dos frases significan lo mismo.

    Cruzar la barrera del idioma sin costo adicional

    El beneficio más subestimado es el emparejamiento multilingüe. Los modelos de embeddings modernos se entrenan en muchos idiomas y mapean significados equivalentes a vectores cercanos sin importar el idioma. "Oxygen plant" en inglés, "central de oxigénio" en portugués y "central de oxígeno" en español caen aproximadamente en la misma región del espacio vectorial.

    Para un exportador esto es transformador. Usted describe su catálogo una sola vez, en un solo idioma. El sistema después lo empareja con:

  • Anuncios en francés en TED y BOAMP
  • Anuncios en portugués en el BASE de Portugal y el PNCP de Brasil
  • Anuncios en español en toda América Latina y en la cartera del Banco Mundial
  • Anuncios en inglés en UNGM y en los portales de los bancos de desarrollo
  • Sin listas de palabras clave traducidas. Sin mantenimiento país por país. El significado cruza la frontera solo, que es exactamente lo que necesita un exportador que rastrea África, América Latina, Medio Oriente y Europa.

    Por qué puntuar es mejor que una marca de sí o no

    Una alerta binaria de "coincidencia encontrada" no le dice nada sobre si conviene gastar una mañana en el documento. Una puntuación de similitud, acompañada de una explicación breve de la IA sobre por qué coincidió, le permite a un responsable de propuestas triar en segundos en lugar de minutos.

    Una configuración práctica se ve así:

  • Banda alta (encaje fuerte): léala hoy, la especificación está de lleno en su rango.
  • Banda media (encaje adyacente): vale un vistazo, quizás con un socio o con un producto que estira su alcance.
  • Banda baja: suprimida, para que el feed se mantenga limpio.
  • Ajuste los umbrales a su apetito. Un consultor que cubre varios clientes puede fijarlos con generosidad; una pyme enfocada puede llevarlos apretados. En cualquier caso la puntuación es una perilla, no un muro, que es justo lo contrario de una lista de palabras clave que solo se puede alargar.

    Una advertencia honesta y breve: los embeddings son muy buenos con la relevancia, no con las reglas duras de elegibilidad. Una licitación puede ser una coincidencia semántica perfecta y aun así estar cerrada para usted por umbrales de facturación, certificaciones o geografía. La puntuación pone rápido las licitaciones correctas frente a usted. Una persona (o una verificación posterior de elegibilidad) sigue siendo quien decide si ofertar.

    Cómo trinta lo pone a trabajar

    Este es el motor que hay debajo del feed de trinta. Usted carga su catálogo una vez, nosotros lo vectorizamos y, a partir de ahí, cada anuncio nuevo de los portales que rastreamos se convierte en embedding, se puntúa contra sus productos y se ordena. En lugar de buscar, usted abre un feed diario de licitaciones emparejadas, cada una con una puntuación de encaje y una línea que explica por qué apareció, en su idioma, extraído de fuentes en varios otros.

    La omisión de PSA frente a oxígeno con la que abrimos este texto es exactamente el tipo de licitación que un radar basado en significado captura y una alerta por palabras clave nunca capturará. El objetivo es simple: dejar de cazar por los portales y empezar a leer una lista corta que ya sabe lo que usted vende.

    Preguntas frecuentes

    ¿Qué es un embedding en el emparejamiento de licitaciones?

    Un embedding es una representación numérica del texto que ubica los significados parecidos cerca unos de otros en un espacio matemático. En el emparejamiento de licitaciones, tanto el catálogo de un proveedor como cada anuncio publicado se convierten en embeddings, de modo que el sistema compara significados y no redacciones. Eso es lo que permite que un anuncio escrito de otra forma o en otro idioma coincida con un producto que realmente encaja.

    ¿Cómo manejan los embeddings varios idiomas?

    Los modelos de embeddings multilingües colocan los significados equivalentes de distintos idiomas cerca unos de otros en el mismo espacio, así que un catálogo descrito en inglés puede coincidir con un anuncio publicado en francés o en portugués sin traducir ninguno de los dos. Para mercados como África y América Latina, donde los compradores más grandes no publican en inglés, esto es lo que vuelve práctica la cobertura.

    ¿Por qué puntuar las licitaciones en lugar de marcarlas con un sí o un no?

    Porque la relevancia es un gradiente, no algo binario. Una puntuación le permite a un equipo triar bajando desde el mejor encaje y parar cuando se acaba el día, que es como se asigna en realidad la capacidad de ofertar. Una marca de sí o no obliga a tomar la decisión del umbral una sola vez, por adelantado, para todos los anuncios futuros.

    Compartir este artículo

    Reference

    Artículos relacionados