Saltar al contenido principal
beginnerPart 8

Agrega búsqueda web a tus llamadas de WEC Inference

· 3 min de lectura
Rafael Fernandes
Ingeniero de PLN y Redactor Técnico en WiLine
Share:
SearXNG+
0/8
🎯 Skill path0/8 earned
AI evals & observability

Supón que has construido un chatbot de soporte o un asistente RAG en WEC. Es sólido en tus documentos y en lo que el modelo ya sabe, pero pregúntale algo actual ("¿cuál es la última versión de X?", precios de hoy, un cambio reciente) y o bien adivina o te dice que su conocimiento está desactualizado. Para cualquier cosa que necesite estar al día, eso es una verdadera brecha.

WEC Inference ahora tiene una herramienta de búsqueda web integrada. Agrégala a una llamada normal /v1/chat/completions y el modelo puede buscar cosas en la web en vivo: la búsqueda se realiza en la propia infraestructura de WiLine (SearXNG), por lo que nada se envía a un proveedor de búsqueda de terceros. Vamos a probarlo.

Reproducibilidad

Las llamadas llegan a https://inference.wiline.com/v1/chat/completions con tu clave API de WEC Inference, modelo Qwen3.5-9B. No hay nada que instalar: la herramienta es parte de la API.


Sin búsqueda web

Una llamada normal, preguntando algo reciente:

curl -sS https://inference.wiline.com/v1/chat/completions \
-H "Authorization: Bearer $WEC_API_KEY" -H "Content-Type: application/json" \
-d '{
"model": "Qwen3.5-9B",
"messages": [{"role": "user", "content": "¿Cuál es la última versión estable de Docker Engine, y cuándo fue lanzada?"}]
}'

El modelo respondiendo solo con datos de entrenamiento — una versión desactualizada Figura 1. Sin herramienta, el modelo no se compromete a una versión — dice que su conocimiento está limitado a su fecha de corte de entrenamiento y te señala las notas de la versión en su lugar.


Con búsqueda web

La misma solicitud, más una herramienta web_search y tool_choice: auto:

curl -sS https://inference.wiline.com/v1/chat/completions \
-H "Authorization: Bearer $WEC_API_KEY" -H "Content-Type: application/json" \
-d '{
"model": "Qwen3.5-9B",
"messages": [{"role": "user", "content": "¿Cuál es la última versión estable de Docker Engine, y cuándo fue lanzada?"}],
"tools": [{
"type": "function",
"function": {
"name": "litellm_web_search",
"description": "Buscar en la web información actual",
"parameters": {
"type": "object",
"properties": {"query": {"type": "string", "description": "La consulta de búsqueda"}},
"required": ["query"]
}
}
}],
"tool_choice": "auto"
}'

El modelo respondiendo con la versión actual, fundamentada en resultados web Figura 2. Mismo modelo, misma pregunta, más la herramienta — ahora devuelve una versión concreta y fecha de lanzamiento obtenida de la web en vivo. El modelo decidió buscar, WEC ejecutó la consulta, y alimentó los resultados antes de responder.

Esa es toda la función: una herramienta en el cuerpo de la solicitud, respuestas actuales saliendo.


Una cosa a tener en cuenta: tokens

La búsqueda web inyecta los resultados en tu aviso, por lo que una llamada con búsqueda cuesta más tokens que una simple (en nuestra prueba, los tokens de aviso pasaron de ~26 a ~2,776). Mantén tool_choice: auto para que el modelo solo busque cuando realmente lo necesita — omitirá la búsqueda para preguntas que ya puede responder.

Cuándo usarlo

  • Sí: versiones actuales, precios, noticias, cualquier cosa después de la fecha de corte de entrenamiento del modelo.
  • Omitir: conocimiento estable que el modelo ya tiene — auto se encarga de eso por ti.

Dirígete a un asistente RAG o un chatbot y puede mantenerse actualizado sin que tengas que configurar un servicio de búsqueda separado.

Finished this tutorial?
Mark it complete to earn Add live web search on your skill path.

Comments & questions

Hit an error, spotted a typo, or have a question? Leave a note below.