Los mejores agentes de investigación con IA en 2026: 10 herramientas para informes con fuentes citables

Turn this article into takeaways for your work.
Each assistant summarizes the article only for you and suggests best practices for your work.
Un agente de investigación con IA es ideal para un analista, estratega o académico que necesita convertir una investigación de literatura o de la web, en varios pasos, en un informe con fuentes, y las mejores opciones se reparten según la tarea: OpenAI Deep Research y Google Gemini Deep Research para investigaciones de uso general dentro de una aplicación de chat que probablemente ya paga, Elicit y Undermind para trabajo formal de literatura académica, y Scite para comprobar si una cita realmente dice lo que se le atribuye. Esta guía clasifica 10 de ellos y trata una pregunta como más importante que cualquier lista de funciones: cuando el agente le entrega una afirmación citada, ¿puede confiar en la cita sin abrir usted mismo cada fuente?
Esa pregunta es toda la historia en esta categoría. Un agente de investigación con IA es distinto de una herramienta de investigación con IA: una herramienta (un cuadro de búsqueda, un asistente de chat, un resumidor) asiste a una persona que sigue en el circuito en cada paso. Un agente planifica por su cuenta una investigación de varios pasos, ejecuta búsquedas, lee lo que encuentra, decide qué comprobar a continuación y devuelve un informe sintetizado con citas adjuntas, en gran medida sin que una persona apruebe cada paso del camino. Esa autonomía es toda la propuesta de valor, y es también exactamente donde una fuente inventada o mal atribuida puede pasar inadvertida. Esta guía se centra en la investigación general y académica: reunir, verificar y sintetizar información en un informe. Si necesita específicamente inteligencia de mercado competitiva o comercial, esa es una decisión de compra más acotada y adyacente que se cubre por separado. Si quiere el diseño subyacente de un agente de investigación, no un producto para comprar, consulte el blueprint del agente de investigación, del lado de la construcción. Y para la definición sencilla de qué convierte algo en un agente, qué es un agente de IA cubre el ciclo de planificar, actuar y observar que implementa alguna versión de cada herramienta de abajo.
Actualizado en agosto de 2026. Los precios de abajo provienen de la propia página de precios o de soporte de cada proveedor cuando cargó durante la verificación; cuando la página de un proveedor bloqueó el acceso automatizado, la cifra se marca como (reportado) y se contrastó con al menos dos rastreadores independientes en lugar de tomarse de una sola fuente.
Qué cambió en 2026
- Deep Research pasó de ser una función de un laboratorio a un requisito básico. OpenAI lanzó el primer modo Deep Research de uso masivo en febrero de 2025; a mediados de 2026, Google, Anthropic y Perplexity ofrecen un modo de investigación agéntico comparable, y la disputa se ha trasladado a la profundidad, la cobertura de fuentes y el precio por ejecución, en lugar de si la función existe siquiera.
- You.com retiró su agente de investigación para consumidores. ARI, el agente de investigación independiente que You.com lanzó para usuarios empresariales a principios de 2025, ya no aparece en su página de precios actual. You.com ahora vende una Research API facturada por uso, dirigida a desarrolladores que crean sus propios agentes, no un informe que un analista ejecuta directamente, así que no figura en la lista clasificada de abajo.
- Las escalas de precios todavía se están definiendo. OpenAI añadió en abril de 2026 una nueva opción de nivel Pro entre Plus y su plan Pro existente de $200, y Google añadió un nivel AI Plus de menor costo por debajo de AI Pro. Ambos movimientos sugieren que los proveedores aún calculan a tientas con qué frecuencia necesita un analista real ejecutar un informe, así que vuelva a revisar la lista de niveles vigente antes de comprar.
Datos Clave
- En 1,600 consultas que pusieron a prueba 8 herramientas de búsqueda con IA frente a 20 editoriales de noticias, los chatbots respondieron incorrectamente más del 60% de las veces en conjunto, con tasas de error por herramienta que iban del 37% (Perplexity) hasta el 94% (Grok 3), según el estudio de 2025 del Tow Center de la Columbia Journalism Review (CJR).
- El mismo estudio de CJR encontró que ChatGPT identificó mal 134 de 200 artículos probados, pero señaló falta de confianza solo 15 veces, lo que significa que un tono seguro no es prueba de que la cita de un agente sea correcta.
- Un estudio anterior de Stanford sobre modelos de uso general (GPT-3.5, Llama 2, PaLM 2) que respondían más de 200,000 consultas de investigación jurídica encontró tasas de alucinación del 69% al 88%, el modo de fallo exacto que los agentes de investigación fundamentados y centrados en las citas existen para reducir (Stanford HAI).
- Los agentes de IA generales pasaron de una tasa de éxito del 12% a cerca del 66% en OSWorld, un benchmark de tareas reales de uso de computadoras, durante el último año, y aun así fallan aproximadamente 1 de cada 3 intentos en tareas estructuradas, según el informe AI Index 2026 de Stanford HAI (Stanford HAI).
- El 57% de las organizaciones ya tiene agentes de IA funcionando en producción, cifra que sube al 67% entre las empresas con 10,000 empleados o más, según la encuesta State of Agent Engineering de LangChain a 1,340 profesionales (LangChain).
Tabla comparativa rápida
| Herramienta | Ideal para | Precio de partida | Principal fortaleza | Principal limitación |
|---|---|---|---|---|
| OpenAI Deep Research | Investigación general dentro de ChatGPT | Plus $20/mes (10 ejecuciones/mes, reportado) | Lectura amplia de la web, decenas de páginas por ejecución | Las ejecuciones tienen tope mensual incluso en Plus |
| Google Gemini Deep Research | Usuarios de Google Workspace | Gratis (5 informes/mes); AI Pro ~$19.99/mes (reportado) | Fundamentado en Google Search más datos de Workspace | El Deep Research completo requiere un nivel de pago |
| Anthropic Claude Research | Analistas que ya viven en Claude | Pro desde $17-20/mes (facturado anual/mensualmente) | Fundamentación nativa en Gmail, Calendar y Docs | Comparte su cuota normal de mensajes, sin límite aparte |
| Perplexity Deep Research | Respuestas rápidas y citadas sin una larga espera | Gratis (~5/día); Pro $20/mes (reportado) | Minutos, no decenas de minutos, por informe | El formato y la profundidad quedan por detrás de las herramientas académicas especializadas |
| Elicit | Revisiones sistemáticas formales de literatura | Gratis; Pro $49/mes ($588/año anual) | Llamado "Research Agent", filtra hasta 5,000 artículos | El uso del Research Agent en el nivel gratuito tiene tope |
| Consensus | Una respuesta rápida y ponderada por la evidencia | Gratis; Premium ~$9/mes; Deep ~$45/mes (reportado) | El medidor de consenso muestra hacia dónde se inclina realmente la evidencia | Creado para preguntas acotadas, no para revisiones completas |
| Undermind | Preguntas de literatura difusas y difíciles de buscar por palabras clave | Gratis (3 búsquedas profundas/mes); Pro $16/mes (anual) | Un agente iterativo que lee y se adapta a lo largo de cientos de artículos | Una sola búsqueda profunda toma de 8 a 10 minutos |
| Exa | Equipos que construyen un agente de investigación a medida | Pago por uso; Search $7/1K solicitudes | Recuperación limpia y estructurada creada para pipelines de agentes | API para desarrolladores, no una herramienta de informes de apuntar y hacer clic |
| Scite | Verificar qué respalda realmente una cita | Individual $20/mes ($12/mes anual, reportado) | Smart Citations: Supporting, Contrasting o Mentioning | No es un agente de investigación primaria ni de descubrimiento |
| STORM | Gratuito, autoalojado, con control total | Gratis, código abierto (MIT) | Investigación multiperspectiva más redacción completa de artículos citados | Sin soporte de proveedor, sin interfaz de consumo pulida |
Qué convierte algo en un agente y no en una herramienta de búsqueda
No todo lo que se comercializa como "investigación con IA" planifica su propio siguiente paso. Un cuadro de búsqueda que devuelve enlaces ordenados es una herramienta. Un chatbot que responde a partir de una sola pasada de búsqueda es una herramienta con una cita encima. Lo que aquí merece la palabra agente es la autonomía sobre varios pasos: el sistema decide qué buscar primero, lee lo que vuelve, decide si eso basta o si necesita buscar de nuevo desde otro ángulo, y solo entonces redacta el informe, en gran medida sin que usted apruebe cada paso intermedio. Por eso OpenAI Deep Research, Gemini Deep Research, Claude Research y Perplexity Deep Research son el eje de esta lista, aunque cada proveedor también ofrezca un modo de chat simple, de una sola pasada, que no califica.

También es la razón por la que esta guía se mantiene distinta de dos vecinas. Las mejores herramientas de IA para investigación académica y las mejores herramientas de IA para investigación científica cubren software de investigación de propósito único, búsqueda de descubrimiento, gestores de referencias, asistentes de redacción, donde una persona conduce cada paso. Varios proveedores de abajo (Elicit, Consensus, Perplexity) aparecen en ambos mundos porque su nivel gratuito o de entrada se parece más a una herramienta de búsqueda y su modo de pago Research Agent o Deep Search es genuinamente agéntico; donde existe esa división, esta guía evalúa específicamente el modo agéntico. Y un agente de investigación no es la misma decisión de compra que un agente de inteligencia de mercado comercial o competitiva, que es un trabajo de investigación más acotado y propio del negocio, con sus propios finalistas.
Esta guía también se sitúa un nivel por debajo de la decisión de compra más amplia. Si aún no ha elegido una clase de plataforma de agentes (sin código, empresarial administrada o framework para desarrolladores), empiece con las mejores plataformas de agentes de IA. Es la misma relación que tienen los mejores agentes de programación con IA con ese pilar: una porción estrecha y específica de una categoría mucho mayor.
Integridad de las citas: qué separa realmente a estas herramientas
Un ranking de agentes de investigación que omita esta sección omite lo único que importa. Todas las herramientas de abajo producen citas. No todas las producen de la misma manera, y el mecanismo subyacente determina cuánto debería confiar en una sin comprobarla usted mismo.

| Herramienta | Cómo obtiene las fuentes | Exposición estructural a la fabricación | Verificar mediante |
|---|---|---|---|
| OpenAI Deep Research | Navegación web en vivo, lee páginas completas | Genera prosa sintetizada que cita fuentes, la exposición estándar de Deep Research | Abrir directamente cada fuente enlazada |
| Google Gemini Deep Research | Web en vivo más fundamentación en Google Search | La misma exposición de síntesis generativa de arriba | Abrir directamente cada fuente enlazada |
| Claude Research | Web en vivo, más Gmail/Calendar/Docs conectados | La misma exposición de síntesis generativa; los documentos conectados añaden una segunda superficie que revisar | Abrir las fuentes; confirmar que las citas de documentos conectados coinciden con el archivo real |
| Perplexity Deep Research | Web en vivo a través de muchas fuentes por ejecución | Síntesis generativa; el estudio de CJR midió la tasa de error del modo de búsqueda base de Perplexity en 37% | Abrir directamente cada fuente enlazada |
| Elicit | Recuperación sobre un índice de 138 millones de artículos (según elicit.com) | Menor: las tablas de extracción toman datos de artículos indexados en lugar de generación libre | Comprobar por muestreo los campos extraídos contra el PDF de origen |
| Consensus | Recuperación sobre un corpus indexado de artículos revisados por pares | Menor: el medidor de consenso refleja estudios indexados reales, no afirmaciones generadas | Revisar los estudios detrás del medidor, no solo el medidor |
| Undermind | Recuperación iterativa, solo muestra artículos que realmente indexó | La más baja de esta lista: devuelve una lista de artículos, no puede inventar un artículo que no esté en sus resultados | Leer los resúmenes de los artículos devueltos antes de citarlos |
| Exa | API de búsqueda neuronal que devuelve resultados estructurados y fundamentados | Depende por completo de cómo configure la síntesis el equipo que construye sobre ella | Cualquier verificación que implemente el equipo que construye sobre Exa |
| Scite | Clasifica enunciados de citas existentes, no genera afirmaciones nuevas | La más baja: informa lo que un artículo citante realmente dijo, con el texto citado a la vista | Leer el contexto citado que muestra Scite, no solo la etiqueta |
| STORM | Web en vivo o documentos aportados por el usuario, cita en todo momento | Síntesis generativa, de la misma categoría que los agentes basados en chat | Comprobar las citas contra las páginas de origen, igual que con cualquier agente generativo |
El patrón: las herramientas creadas en torno a generar prosa sintetizada (OpenAI, Gemini, Claude, Perplexity, STORM) conllevan por diseño más exposición a la fabricación, porque la generación de lenguaje y la exactitud de las citas son dos capacidades separadas unidas entre sí. Las herramientas creadas en torno a la recuperación y la clasificación (Elicit, Consensus, Undermind, Scite) estructuralmente no pueden inventar una fuente como puede hacerlo un resumen generativo, porque su resultado se parece más a "esto es lo que encontré" que a "esto es lo que concluí". Ninguna categoría es intrínsecamente más útil; responden preguntas distintas. Pero si un entregable depende de una cifra o una cita específica, sepa qué categoría la produjo antes de citarla más allá.
Cobertura de fuentes y acceso
| Herramienta | Web en vivo | Índice académico | Contenido de pago | Notas |
|---|---|---|---|---|
| OpenAI Deep Research | Sí | Sin índice dedicado | Omite o señala lo que no puede acceder | Amplitud de la web general, no específico de literatura |
| Gemini Deep Research | Sí, mediante Google Search | Sin índice dedicado | Omite o señala lo que no puede acceder | Sólido para todo lo que Google indexa |
| Claude Research | Sí | Sin índice dedicado | Omite o señala; puede leer Docs/Drive conectados | Mejor cuando sus propios documentos forman parte de la respuesta |
| Perplexity Deep Research | Sí | El modo Academic Focus limita los resultados a fuentes revisadas por pares | Omite o señala lo que no puede acceder | Herramienta web general con un modo académico, no creada para eso |
| Elicit | Limitada, primero el índice | 138 millones de artículos (elicit.com) | Texto completo donde está abierto | Creado para literatura, no para preguntas generales de la web |
| Consensus | No | Corpus indexado de artículos revisados por pares | A nivel de resumen donde el texto completo está cerrado | Ideal para una pregunta de evidencia específica y respondible |
| Undermind | No | Gran corpus de literatura indexado, tamaño exacto no confirmado de forma independiente | A nivel de resumen donde el texto completo está cerrado | La búsqueda iterativa encuentra artículos que la búsqueda por palabras clave pasa por alto |
| Exa | Sí, búsqueda neuronal en tiempo real | Configurable por el equipo que construye sobre ella | Depende de la configuración | Infraestructura, la cobertura es la que usted construya |
| Scite | Sin descubrimiento independiente | Más de 1.6 mil millones de enunciados de citas (scite.ai) | Lee el contexto de la cita, no los artículos completos | Capa de verificación, no un motor de descubrimiento |
| STORM | Sí, backend de búsqueda intercambiable (Bing, DuckDuckGo, You.com o sus propios documentos) | Lo que configure en el backend | Depende del backend | Usted elige el motor de recuperación |
El flujo de verificación: qué comprobar antes de confiar en un informe citado
Ninguna de las herramientas de arriba reemplaza al analista. Cada una está diseñada para entregar un borrador a una persona que sigue siendo dueña del juicio final, el mismo patrón de traspaso que incorpora por defecto el blueprint del agente de investigación: el agente sintetiza, una persona verifica y decide. Siga esta lista antes de que un informe citado salga de sus manos:

- Abra cada fuente en la que se apoya el informe, no solo las que parecen sorprendentes. El estudio de CJR encontró que las respuestas erróneas y de tono seguro superaban a las marcadas como inciertas en una proporción aproximada de 9 a 1 en ChatGPT, así que el tono no dice nada sobre la exactitud.
- Pase las citas académicas por un verificador como Scite antes de repetirlas. Una cita que lleva a un artículo real y recuperable aún puede tergiversar lo que ese artículo encontró; la etiqueta Supporting, Contrasting o Mentioning de Scite (con el texto citado real) detecta esa brecha.
- Contraste cualquier afirmación de una sola fuente con una segunda fuente independiente antes de que entre en un entregable con su nombre, la misma disciplina de jerarquía de autoridad que recomienda el blueprint del lado de la construcción para fuentes en conflicto.
- Confirme que el agente realmente leyó las fuentes de pago o con inicio de sesión que cita, en lugar de inferir el contenido a partir de un título o un fragmento de búsqueda. La mayoría de las herramientas lo señalan si usted lo busca; pocas lo muestran sin que se les pida.
- Revise la fecha de recuperación. Un informe está tan actualizado como su última pasada de búsqueda; una línea de "fuentes recuperadas por última vez" (o su ausencia) le dice si está viendo evidencia de hoy o un borrador obsoleto.
- Conserve la lista de fuentes en bruto y las marcas de tiempo, no solo el resumen pulido, para poder reconstruir la investigación si más adelante se cuestiona un hallazgo. Elicit, Exa y Undermind lo conservan por defecto; los agentes basados en chat a menudo exigen que usted lo pida de forma explícita.
Para un marco más general sobre cómo comprobar si el resultado de cualquier agente es lo bastante fiable como para actuar sobre él, cómo evaluar agentes de IA cubre métricas de éxito de tareas y la calificación del comportamiento de varios pasos más allá de la sola verificación de citas. Si el agente de investigación debe superar una revisión de compras o de seguridad antes de que un equipo regulado pueda tocarlo, las mejores plataformas empresariales de agentes de IA cubren específicamente esa capa de gobernanza.
1. OpenAI Deep Research: la lectura de la web más amplia dentro de ChatGPT
Deep Research funciona como un modo agéntico dentro de ChatGPT: planifica una búsqueda de varios pasos, lee decenas de páginas durante una sola ejecución y puede tardar de 5 a 30 minutos en devolver un informe citado, según lo amplia que sea la pregunta. Para un suscriptor de Plus, es la forma más rápida de obtener una pasada de investigación agéntica sin añadir un nuevo proveedor, ya que vive dentro de un producto que la mayoría de los profesionales ya tiene abierto.
La trampa es el tope mensual. Plus incluye 10 ejecuciones de Deep Research al mes, lo que suena generoso hasta que usa dos o tres en una sola semana intensa de investigación. OpenAI añadió en abril de 2026 una nueva opción de nivel Pro de $100 entre Plus y su plan Pro existente de $200; el nivel de $200 incluye 250 ejecuciones al mes, dirigido a quienes usan Deep Research como herramienta diaria y no ocasional.
| Lo que obtiene | Lo que no obtiene |
|---|---|
| Lectura amplia y general de la web a lo largo de decenas de páginas por ejecución | Solo 10 ejecuciones/mes en Plus, fáciles de agotar |
| Ningún proveedor nuevo si ya paga ChatGPT | Sin índice dedicado de artículos académicos |
| Funciona dentro de una herramienta que la mayoría de los analistas ya conoce | Los niveles de precios cambiaron dos veces en 2026; vuelva a revisar antes de comprar |
Precios (reportado, la página de precios de OpenAI bloqueó la verificación directa al momento de escribir): Plus $20/mes (10 ejecuciones de Deep Research/mes); un nuevo nivel Pro de $100/mes añadido en abril de 2026; Pro a $200/mes (250 ejecuciones/mes). Confirme la oferta vigente en openai.com/chatgpt/pricing antes de comprar.
Ideal para: Analistas que ya usan ChatGPT y quieren investigación web de uso general sin añadir una herramienta especializada.
2. Google Gemini Deep Research: fundamentado en Google Search y Workspace
El modo Deep Research de Gemini apuesta por la misma ventaja que Google siempre tiene: la web abierta más lo que vive en su Workspace y en su historial de búsqueda. Es el único agente de esta lista con un nivel gratuito real para la función de varios pasos en sí, no solo un modo de chat; el plan gratuito de Google incluye hasta cinco informes de Deep Research al mes antes de que tenga que pagar algo.
Los niveles de pago escalan por uso y no por función. AI Pro (reportado en torno a $19.99/mes) habilita el Deep Research completo con el modelo Gemini actual de Google, y AI Ultra (reportado en $99.99/mes por 5x de uso o $199.99/mes por 20x) añade los límites más altos junto con Deep Think, el modo de razonamiento más deliberativo de Google. Google también introdujo en 2026 un nivel AI Plus de menor costo entre Free y Pro, aunque su precio exacto en USD no pudo confirmarse al momento de escribir; consulte gemini.google/subscriptions para el precio regional vigente.
| Lo que obtiene | Lo que no obtiene |
|---|---|
| Un nivel gratuito genuino: 5 informes de Deep Research/mes | El Deep Research con todas las funciones sigue requiriendo AI Pro |
| Fundamentado en Google Search más datos de Workspace si se conectan | Sin índice dedicado de artículos académicos |
| Escalamiento claro por uso (5x, 20x) en el nivel Ultra | El precio de Ultra es un salto real para usuarios ocasionales |
Precios (reportado; la página de precios de Google devolvió cifras localizadas por región al momento de escribir): Free (5 informes/mes); AI Pro ~$19.99/mes; AI Ultra $99.99/mes (límites 5x) o $199.99/mes (límites 20x). Confirme los niveles vigentes en gemini.google/subscriptions.
Ideal para: Equipos estandarizados en Google Workspace y cualquiera que quiera probar gratis un agente de Deep Research real antes de pagar.
3. Anthropic Claude Research: fundamentación nativa en el espacio de trabajo
La función Research de Claude, confirmada en la propia documentación de soporte de Anthropic, funciona de forma agéntica: ejecuta varias búsquedas que se apoyan unas en otras, decide qué investigar a continuación y entrega lo que Anthropic describe como respuestas exhaustivas "en minutos, con citas fáciles de verificar". El diferenciador es en qué puede fundamentarse más allá de la web abierta: cuando se conecta, Claude Research extrae de Gmail, Google Calendar y Google Docs, de modo que un informe puede citar sus propios documentos internos junto con fuentes externas en una sola pasada.
Research está disponible en Pro y superiores (Pro, Max, Team, Enterprise), no en el plan gratuito, y consume del mismo fondo de uso que la conversación ordinaria en lugar de tener su propia asignación, así que una semana intensa de investigación agota más rápido sus límites habituales.
| Lo que obtiene | Lo que no obtiene |
|---|---|
| Fundamentación nativa en Gmail, Calendar y Docs cuando se conectan | Sin índice dedicado de artículos académicos |
| Búsqueda agéntica de varios pasos que se apoya en sus propios hallazgos | Sin cuota aparte; comparte su límite normal de mensajes |
| Respuestas citadas que Anthropic describe como entregadas en minutos | No disponible en el plan gratuito |
Precios: Pro $17/mes (facturado anualmente) o $20/mes (facturado mensualmente); Max desde $100/mes; Team $20-100/puesto/mes; Enterprise a medida, según claude.com/pricing.
Ideal para: Analistas que ya trabajan en Claude y quieren una investigación fundamentada en sus propios documentos de Workspace, no solo en la web abierta.
4. Perplexity Deep Research: el tiempo de respuesta más rápido de esta lista
El modo Deep Research de Perplexity sacrifica algo de profundidad por velocidad: ejecuta varias búsquedas y pasadas de razonamiento, pero está hecho para devolver un informe citado en minutos en lugar de las ejecuciones más largas por las que se conoce el modo de OpenAI. Para un estratega que se mueve rápido y necesita un primer borrador defendible antes de una reunión, no una revisión sistemática definitiva, esa velocidad es toda la propuesta.
El nivel gratuito incluye un puñado de consultas de Deep Research al día (reportado en torno a cinco), y Pro a $20/mes amplía esa asignación de forma sustancial. El modo Academic Focus de Perplexity, disponible en todos los niveles, limita los resultados específicamente a fuentes revisadas por pares, algo que conviene activar para todo lo sensible a las citas. Las pruebas independientes (el estudio de CJR mencionado arriba) midieron el modo de búsqueda base de Perplexity en una tasa de error del 37%, la más baja de las ocho herramientas probadas, pero aun así una tasa de error real, no un error de redondeo.
| Lo que obtiene | Lo que no obtiene |
|---|---|
| Minutos, no decenas de minutos, por informe | La profundidad y el formato quedan por detrás de las herramientas académicas especializadas |
| El modo Academic Focus limita los resultados a fuentes revisadas por pares | La asignación diaria del nivel gratuito es escasa para un uso intensivo |
| La tasa de error medida más baja entre 8 herramientas en el estudio de CJR | 37% sigue siendo una tasa de error real, no un aprobado |
Precios (reportado; la página de precios de Perplexity bloqueó la verificación directa al momento de escribir): Free (~5 consultas de Deep Research/día); Pro $20/mes o $200/año; Max $200/mes; Enterprise Pro $40/usuario/mes (50 consultas de Deep Research/mes). Confirme los límites vigentes en perplexity.ai/pro.
Ideal para: Estrategas que necesitan una primera pasada rápida y citada más que una exhaustiva.
5. Elicit: un producto que se llama literalmente "Research Agent"
Elicit es la coincidencia más literal con esta categoría: su propia página de precios nombra la función "Research Agent" y "Research Reports" directamente, creada para el trabajo de revisión sistemática y no para preguntas generales de la web. El Systematic Review Workflow puede filtrar hasta 5,000 artículos en el plan Pro (40,000 en Enterprise) y extraer datos estructurados y comparables en columnas que usted define, convirtiendo lo que antes eran semanas de filtrado manual en una pasada de unas horas que una persona aún revisa.
Como Elicit recupera de una base indexada de 138 millones de artículos en lugar de generar resúmenes web libres, su exposición a la fabricación es estructuralmente menor que la de los agentes basados en chat de arriba: una celda extraída de una tabla se rastrea hasta un artículo específico que usted puede abrir, no un párrafo sintetizado. El plan Basic gratuito le da acceso real (búsqueda y chat ilimitados sobre todo el índice), pero limita el uso de Research Agent y Research Report, así que el trabajo serio de revisión sistemática requiere Pro.
| Lo que obtiene | Lo que no obtiene |
|---|---|
| Un Research Agent literal, filtra hasta 5,000 artículos (Pro) | El uso del Research Agent en el nivel gratuito tiene tope |
| Extracción estructurada en tablas comparables, no en prosa | No está pensado para investigación empresarial ni web general |
| Menor exposición a la fabricación: basado en recuperación, no generativo | Se necesita el precio Enterprise para las revisiones más grandes (40K artículos) |
Precios: Basic gratuito (uso limitado de Research Agent/Report); Pro $49/mes o $588/año facturado anualmente; Scale $169/mes o $2,028/año facturado anualmente (5x el uso de Pro); Enterprise a medida, según elicit.com/pricing.
Ideal para: Investigadores de doctorado, revisores sistemáticos y equipos de I+D que necesitan una revisión de literatura estructurada y defendible, no una respuesta rápida.
6. Consensus: respuestas rápidas ponderadas por la evidencia
Consensus está creado en torno a una sola tarea: responder una pregunta de investigación específica con el balance real de la evidencia revisada por pares que la respalda, mostrado como un medidor de consenso visual (cuántos estudios coinciden, discrepan o quedan mixtos) en lugar de un único párrafo sintetizado. Plantee una pregunta acotada y respondible y Consensus suele llegar más rápido a una respuesta defendible que un modo general de Deep Research, porque no intenta escribir un ensayo, sino mostrarle dónde se sitúa realmente la evidencia.
La función Deep Search (nivel Deep, reportado en torno a $45/mes) lo extiende al terreno agéntico: sintetiza hallazgos de hasta 200 artículos por consulta en lugar de mostrar un solo medidor. El nivel Free incluye una asignación real pero limitada (15 mensajes Pro y 3 Deep Searches al mes), suficiente para probar si el formato encaja con su flujo de trabajo antes de pagar.
| Lo que obtiene | Lo que no obtiene |
|---|---|
| El medidor de consenso muestra el acuerdo real entre estudios indexados | Creado para preguntas acotadas y respondibles, no para exploración amplia |
| Deep Search sintetiza hasta 200 artículos por consulta | No es un flujo completo de revisión sistemática como Elicit |
| Un nivel gratuito realmente utilizable para probar el formato | El precio del nivel Deep queda por encima de varios competidores con profundidad similar |
Precios (reportado; coherente con consensus.app/pricing según se verificó en julio de 2026): Free (15 mensajes Pro, 3 Deep Searches/mes); Premium ~$9/mes; Deep ~$45/mes (200 Deep Searches/mes).
Ideal para: Quien necesita una respuesta rápida y ponderada por la evidencia a una pregunta específica, no una revisión completa.
7. Undermind: el agente iterativo creado para preguntas difusas
Undermind existe para resolver un modo de fallo específico de la búsqueda por palabras clave: el artículo que coincide con su pregunta real pero no comparte su vocabulario. En lugar de unas pocas palabras clave, usted describe en un párrafo lo que busca, y el agente de Undermind ejecuta búsquedas sucesivas, lee los artículos candidatos y afina la siguiente ronda de búsqueda según lo aprendido, recorriendo cientos de artículos en unos 8 a 10 minutos por Deep Search.
Como su resultado es una lista ordenada y anotada de artículos que realmente encontró y leyó, y no una narrativa generada, Undermind tiene la exposición estructural a la fabricación más baja de las herramientas de esta lista afines a lo generativo: no puede citar un artículo que no esté en sus propios resultados recuperados. El plan Free incluye 3 búsquedas profundas al mes; Pro (confirmado en $16/mes facturado anualmente, cerca de 10x el uso gratuito) es el nivel realista para quien lo usa con regularidad.
| Lo que obtiene | Lo que no obtiene |
|---|---|
| Un agente iterativo que adapta su búsqueda a medida que lee | Una sola búsqueda profunda toma de 8 a 10 minutos, no es instantánea |
| No puede fabricar un artículo; el resultado es lo que realmente recuperó | Devuelve una lista de artículos, no un informe narrativo sintetizado |
| El nivel Team comparte el historial de búsquedas para evitar trabajo duplicado | Las 3 búsquedas/mes del nivel gratuito no cubren un uso regular |
Precios: Free (3 búsquedas profundas/mes, $0); Pro $16/mes facturado anualmente (cerca de un 20% menos que mes a mes); Team $15/persona/mes facturado anualmente; Enterprise a medida, según undermind.ai/pricing.
Ideal para: Investigadores con una pregunta genuinamente difusa o difícil de buscar por palabras clave que necesitan una cobertura que un buscador normal pasa por alto.
8. Exa: la capa de recuperación para un agente construido a medida
Exa no es un agente generador de informes al que usted inicia sesión y le hace una pregunta. Es una API de búsqueda creada específicamente para que la llamen agentes de IA y LLM, y que devuelve resultados limpios, estructurados y citables en lugar de HTML en bruto. Si un equipo quiere control total sobre cómo un agente de investigación obtiene información, qué cuenta como fuente válida, cómo se formatean las citas, Exa es la capa de infraestructura bajo esa construcción, el mismo papel que AWS Bedrock AgentCore cumple para los agentes de uso general.
Su Agent API de junio de 2026 lo extendió aún más, con precios que abarcan unidades de cómputo, llamadas de búsqueda y complementos de enriquecimiento para equipos que ejecutan Exa dentro de un pipeline autónomo más grande y no en una sola llamada de búsqueda. Esa flexibilidad es también la limitación honesta: aquí no hay una interfaz de informes pulida. Un analista sin apoyo de ingeniería no obtiene nada directamente utilizable de Exa; un equipo técnico obtiene una capa de búsqueda sobre la que otros productos de agentes de esta lista están construidos en parte.
| Lo que obtiene | Lo que no obtiene |
|---|---|
| Recuperación limpia, estructurada y lista para agentes, no resultados de búsqueda en bruto | Sin interfaz para el usuario final; es una API para desarrolladores |
| Precio de pago por uso que escala con el volumen real de consultas | No la puede usar directamente un analista no técnico |
| Agent API (junio de 2026) creada para pipelines de investigación completos | Requiere tiempo de ingeniería para convertirla en una herramienta de informes terminada |
Precios: Pago por uso; $20 de crédito de registro más $10/mes de crédito gratuito. Search $7/1,000 solicitudes; Deep/Research search $12-15/1,000 solicitudes; Agent API con precio por cómputo ($0.10/unidad), llamadas de búsqueda ($0.005 cada una) y complementos de enriquecimiento, según exa.ai.
Ideal para: Equipos de ingeniería y de datos que construyen un agente de investigación interno y a medida en lugar de comprar uno terminado.
9. Scite: la capa de integridad de las citas
Scite no compite con los agentes generadores de informes de arriba; revisa su tarea, y la de todos los demás. Las Smart Citations clasifican cada uno de más de 1.6 mil millones de enunciados de citas indexados como Supporting, Contrasting o Mentioning respecto de la afirmación a la que están asociados, mostrando el texto citado real, de modo que usted puede ver en segundos si una cita realmente respalda una afirmación o solo hace referencia al mismo tema general.
Eso convierte a Scite en el complemento natural de todo agente generativo de esta lista: pase por Scite las citas clave de un informe de Deep Research antes de repetirlas en un entregable. No es una herramienta de descubrimiento por sí sola, y no le redactará un informe sintetizado; responde bien una pregunta más acotada y de mayor riesgo.
| Lo que obtiene | Lo que no obtiene |
|---|---|
| Clasificación Supporting/Contrasting/Mentioning con contexto citado | No es por sí sola un agente de descubrimiento ni de generación de informes |
| Capa de verificación que se combina con cualquier herramienta de arriba | Más de 1.6 mil millones de enunciados de citas es una cobertura profunda pero no exhaustiva |
| Forma rápida de detectar una cita que no dice lo que afirma | Requiere que usted ya tenga una cita que comprobar |
Precios (reportado; la página de precios de scite.ai bloqueó la verificación directa al momento de escribir): Individual $20/mes, o $12/mes facturado anualmente ($144/año); Team reportado en torno a $30/usuario/mes; Enterprise a medida.
Ideal para: Quien está a punto de apoyarse en una cita académica en un entregable real, usado junto con una herramienta de descubrimiento o de Deep Research, no en lugar de una.
10. STORM: gratuito, de código abierto y con control total
STORM (Synthesis of Topic Outlines through Retrieval and Multi-perspective Question Asking), del laboratorio OVAL de Stanford, es una entrada genuinamente distinta en esta lista: un sistema de investigación de código abierto, no un producto comercial. Ejecuta un proceso en dos etapas, simulando conversaciones de expertos multiperspectiva basadas en fuentes web para investigar un tema, y luego redactando un artículo completo, citado y al estilo Wikipedia a partir de lo encontrado. Co-STORM lo extiende con un modo colaborativo en el que una persona participa junto con "expertos" de IA y un agente moderador en torno a un mapa mental compartido y en evolución.

El código tiene licencia MIT y se mantiene activamente en GitHub (más de 30,000 estrellas), y hay una vista previa de investigación alojada y limitada en storm.genie.stanford.edu para quien quiera probarlo sin configuración. Ejecutarlo para trabajo real implica aportar su propia clave de API de un LLM y elegir un backend de recuperación (Bing, DuckDuckGo, la API de You.com o su propio conjunto de documentos), que es la contrapartida de no pagar nada: sin soporte de proveedor, sin SLA, sin interfaz de consumo pulida. Es la misma contrapartida del autoalojamiento que se trata en los mejores frameworks de agentes de IA de código abierto: control total a cambio de hacerse cargo de la ingeniería.
| Lo que obtiene | Lo que no obtiene |
|---|---|
| Gratuito y de código abierto (licencia MIT), sin suscripción | Sin soporte de proveedor ni SLA, solo mantenimiento comunitario |
| Investigación multiperspectiva más redacción completa de artículos en un solo pipeline | Requiere su propia clave de API de un LLM y un backend de recuperación para funcionar de verdad |
| Co-STORM añade un modo colaborativo con una persona en el circuito | La demo alojada es limitada; el uso real implica autoalojar |
Precios: Gratuito, de código abierto (licencia MIT). Vista previa de investigación alojada gratuita en storm.genie.stanford.edu. Los costos reales de despliegue son su propio uso de API de un LLM más un backend de búsqueda, según github.com/stanford-oval/storm.
Ideal para: Académicos y equipos técnicos que quieren control total sobre el pipeline de investigación y se sienten cómodos autoalojando.
Cómo elegir: marco de decisión
Elija un agente de investigación según la tarea que necesita que termine: síntesis amplia, fundamentación en el espacio de trabajo, descubrimiento de literatura, verificación de citas o un pipeline a medida.

| Si necesita... | Elija... | Por qué |
|---|---|---|
| Un agente de Deep Research dentro de una aplicación de chat que ya paga | OpenAI Deep Research o Gemini Deep Research | Ningún proveedor nuevo; lectura amplia y general de la web |
| Investigación fundamentada en su propio Gmail, Docs o Calendar | Claude Research | El único con conectores nativos de Workspace junto a la búsqueda web |
| Un primer borrador rápido y citado, no uno exhaustivo | Perplexity Deep Research | Minutos por informe, y sigue siendo genuinamente de varios pasos |
| Una revisión sistemática formal y defendible sobre miles de artículos | Elicit | Research Agent diseñado para ello, con filtrado estructurado al estilo PRISMA |
| Una respuesta rápida a una pregunta de investigación específica y acotada | Consensus | El medidor de consenso muestra dónde se sitúa realmente la evidencia |
| Descubrimiento profundo de literatura ante una pregunta difusa y difícil de buscar por palabras clave | Undermind | El agente iterativo adapta su búsqueda a medida que lee |
| Verificar que una cita realmente respalda la afirmación a la que está asociada | Scite | Clasificación diseñada para ello, no un generador de informes competidor |
| Control total de ingeniería para construir un agente de investigación a medida | Exa (API) o STORM (código abierto) | Exa es la capa de recuperación; STORM es el pipeline gratuito y autoalojado |
Tabla de tamaño y perfil
| Herramienta | Ideal para | No ideal para |
|---|---|---|
| OpenAI Deep Research | Analistas individuales que ya están en ChatGPT | Equipos que necesitan un índice académico dedicado |
| Gemini Deep Research | Equipos estandarizados en Google Workspace | Equipos fuera del ecosistema de Google |
| Claude Research | Analistas que viven en Claude y Google Workspace | Equipos que quieren un índice de artículos diseñado para ello |
| Perplexity Deep Research | Investigación generalista de respuesta rápida | Revisiones sistemáticas formales y exhaustivas |
| Elicit | Investigadores de doctorado, revisores sistemáticos, equipos de I+D | Preguntas de negocio rápidas y puntuales |
| Consensus | Quien tiene una pregunta de evidencia acotada y respondible | Revisiones de literatura amplias y exploratorias |
| Undermind | Investigadores con una pregunta difusa y difícil de buscar por palabras clave | Equipos que quieren una narrativa sintetizada, no una lista de artículos |
| Exa | Equipos de ingeniería que construyen un agente a medida | Analistas no técnicos que quieren una herramienta lista para usar |
| Scite | Quien está a punto de citar un artículo en un entregable real | Descubrimiento primario; no es un motor de búsqueda por sí solo |
| STORM | Usuarios técnicos o académicos que se sienten cómodos autoalojando | Quien quiere soporte de proveedor o una interfaz de nivel de consumo |
Errores de compra de agentes de investigación que conviene evitar
Las compras de agentes de investigación salen mal cuando los equipos confían en un resultado pulido, comparan la unidad equivocada o eligen una herramienta para una tarea de investigación que no fue creada para terminar.

| Error | Cómo se ve | Qué hacer en su lugar |
|---|---|---|
| Confiar en una cita porque está bien formateada | Una nota al pie limpia que enlaza a una fuente que no dice lo que se le atribuye | Abra la fuente, o pásela por Scite antes de repetir la afirmación |
| Tratar un tono seguro como indicador de exactitud | Un agente afirma una cifra sin ningún lenguaje de cautela | Según los hallazgos de CJR, la confianza y la corrección no estaban correlacionadas; verifique de todos modos |
| Usar un agente de descubrimiento para sintetizar, o al revés | Pedirle a Undermind un resumen narrativo, o pedirle a Perplexity que filtre 5,000 artículos | Adecue la herramienta a la tarea: descubrimiento, síntesis y verificación son tareas distintas |
| Pagar un nivel Pro antes de llegar al límite del nivel gratuito | Suscribirse a Elicit Pro antes de probar qué cubre la asignación gratuita del Research Agent | Agote primero el nivel gratuito con una pregunta real |
| Suponer que "Deep Research" significa la misma asignación en todas partes | Comparar las 10 ejecuciones/mes de OpenAI con la asignación diaria de Perplexity como si fueran equivalentes | Compare la unidad real: ejecuciones/mes, consultas/día o artículos filtrados |
| Saltarse el rastro de auditoría | Borrar la lista de fuentes en bruto una vez que el resumen parece terminado | Conserve las fuentes y las fechas de recuperación junto a todo lo que quizá deba defender más adelante |
| Suponer que se leyó realmente una fuente de pago | Un agente cita un artículo de pago por su título sin señalar el fallo de acceso | Verifique si la herramienta señala lo que no pudo alcanzar; la mayoría adivina en silencio |
Preguntas frecuentes sobre agentes de investigación con IA
¿Cuál es la diferencia entre un agente de investigación con IA y una herramienta de investigación con IA?
Una herramienta de investigación con IA (un cuadro de búsqueda, un gestor de citas, un asistente de chat) ayuda a una persona que conduce cada paso. Un agente de investigación con IA planifica por su cuenta una investigación de varios pasos: busca, lee, decide qué comprobar a continuación y devuelve un informe sintetizado y citado con mucha menos supervisión paso a paso.
¿Con qué frecuencia fabrican citas los agentes de investigación con IA?
Un estudio de 2025 de la Columbia Journalism Review sobre 8 herramientas de búsqueda con IA (no limitado específicamente a los modos Deep Research) encontró que los chatbots respondieron incorrectamente más del 60% de las veces en conjunto a lo largo de 1,600 consultas de noticias, con tasas de error por herramienta del 37% al 94%. Por eso existe el flujo de verificación de esta guía: trate toda afirmación citada como no verificada hasta que usted mismo haya abierto la fuente.
¿OpenAI Deep Research o Gemini Deep Research es más preciso?
No existe un benchmark de precisión comparativo verificado de forma independiente que contraste a ambos específicamente. Los dos son agénticos, los dos pueden toparse con muros de pago que no logran superar, y ninguno reemplaza la lectura de la fuente original. Trate las puntuaciones de benchmarks publicadas por los proveedores como una señal inicial, no como una respuesta final.
¿Estos agentes pueden acceder a revistas académicas de pago?
Por lo general no, a menos que usted tenga acceso institucional o personal conectado. La mayoría de las herramientas omiten el contenido de pago o señalan que encontraron una fuente pero no pudieron superar el muro de pago; unas pocas citan el título en silencio sin revelar que no se leyó el texto completo, que es exactamente lo que hay que comprobar.
¿Cuál es la forma más barata de probar un agente de investigación con IA?
Empiece con un nivel gratuito: el plan gratuito de Gemini incluye 5 informes de Deep Research al mes, el plan Basic de Elicit incluye un uso limitado de Research Agent, Undermind ofrece 3 búsquedas profundas gratuitas al mes y STORM de Stanford tiene una demo alojada gratuita que no requiere cuenta.
¿Deberían los académicos usar Elicit o Consensus?
Depende de la forma de la pregunta. Elicit está creado para revisiones sistemáticas formales que filtran miles de artículos y extraen datos estructurados y comparables. Consensus está creado para una respuesta rápida, acotada y ponderada por la evidencia a una pregunta específica. Muchos investigadores usan ambos en distintas etapas del mismo proyecto.
¿Exa es un agente de investigación que pueda usar directamente?
No por sí solo. Exa es una API de búsqueda a la que llaman otros agentes y desarrollos internos para la recuperación. Un analista no técnico no obtiene nada utilizable directamente de Exa; un equipo técnico obtiene una capa de datos limpia sobre la que construir un agente de investigación a medida.
¿En qué se diferencia esto de los agentes de IA para investigación de mercado?
Esta guía cubre la investigación general y académica: reunir, verificar y sintetizar información en un informe con fuentes. La inteligencia de mercado comercial y competitiva, es decir, seguir a competidores, dimensionar un mercado, monitorear un sector, es una tarea de investigación más acotada y propia del negocio, con su propia decisión de compra aparte.
¿Sigo necesitando un analista humano si uso uno de estos agentes?
Sí. Cada agente de aquí está diseñado para entregar un borrador, no una respuesta final. La tarea del agente es la síntesis; el juicio final, decidir si una fuente es autorizada, si una afirmación es segura de repetir y qué significa realmente el hallazgo, sigue correspondiendo a una persona.
Qué hacer a continuación
Elija una herramienta que encaje con su tarea real, no el nombre más grande de esta lista. Si su pregunta es exploratoria y general, ejecute OpenAI Deep Research o Gemini Deep Research sobre ella, ya que probablemente ya tiene la suscripción. Si se trata de una revisión formal de literatura, empiece con el nivel gratuito de Elicit en una pregunta real y vea si el Systematic Review Workflow cubre lo que necesita antes de pagar Pro. En cualquier caso, siga la lista de verificación de arriba con el primer informe antes de citar algo de él en trabajo real, y si intenta justificar el costo de la suscripción ante quien la aprueba, el marco de ROI de agentes de IA cubre cómo medir si el tiempo ahorrado realmente se sostiene frente al precio.

On this page
- Qué cambió en 2026
- Datos Clave
- Tabla comparativa rápida
- Qué convierte algo en un agente y no en una herramienta de búsqueda
- Integridad de las citas: qué separa realmente a estas herramientas
- Cobertura de fuentes y acceso
- El flujo de verificación: qué comprobar antes de confiar en un informe citado
- 1. OpenAI Deep Research: la lectura de la web más amplia dentro de ChatGPT
- 2. Google Gemini Deep Research: fundamentado en Google Search y Workspace
- 3. Anthropic Claude Research: fundamentación nativa en el espacio de trabajo
- 4. Perplexity Deep Research: el tiempo de respuesta más rápido de esta lista
- 5. Elicit: un producto que se llama literalmente "Research Agent"
- 6. Consensus: respuestas rápidas ponderadas por la evidencia
- 7. Undermind: el agente iterativo creado para preguntas difusas
- 8. Exa: la capa de recuperación para un agente construido a medida
- 9. Scite: la capa de integridad de las citas
- 10. STORM: gratuito, de código abierto y con control total
- Cómo elegir: marco de decisión
- Tabla de tamaño y perfil
- Errores de compra de agentes de investigación que conviene evitar
- Qué hacer a continuación