Autorizado por Christopher Penn a través de la substapa de "Almost Timely News",

He estado preparando un nuevo curso para Trust Insights, AI for Write (y Writers), que saldrá el 25 de agosto, y durante el proceso de creación de ese curso, me di cuenta de que nunca he caminado a través de la creación de un sistema de AI agente de descuento.

Por un tiempo, muchos de nosotros que trabajamos en “corporate” hemos tenido acceso a lo que se siente como cantidades ilimitadas de IA (aunque ese paseo libre está llegando a su fin en las tiendas de negocios gracias a facturas absurdamente grandes). Para la persona promedio que no tiene el respaldo de una corporación, ¿cómo podemos aprovechar el poder de los sistemas agentes sin sacar nuestras carteras?

Esto vuelve a una pregunta de Leslie en el grupo Analytics for Marketers Slack:

“¿Ha hecho un video o post con recomendaciones para un segundo equipo barato establecido alguien puede utilizar para construir su máquina AI separada?”

Así que esta semana, vamos a ser desechables.

Advertencias, descargos, revelaciones

Si trabajas en una empresa, por favor, compruebe con IT antes de instalar software de forma gratuita. Como ex profesional de TI, le agradecemos.

En segundo lugar, en este número hablaré de modelos de IA hechos por China como Qwen y DeepSeek. Hay una diferencia de HUGE entre un modelo chino alojado por una empresa en la República Popular China (PRC), y un modelo chino alojado por una empresa fuera del PRC.

Es manifiestamente inseguro utilizar cualquier modelo de IA hospedado en el PRC para cualquier tipo de información confidencial, período. Totalmente bien para utilizar esos modelos para cosas que son completamente públicas, como solicitudes de investigación.

Sin embargo, es completamente seguro utilizar modelos de IA hechos por China en su propio hardware, o en una infraestructura que es confiable. Hay muchos, muchos grandes proveedores de inferencia que tienen cosas como Zero Data Retention (ZDR) hosting que son incluso más seguros de usar que los modelos Big Tech porque los proveedores garantizan que no guardan sus datos en absoluto. (La mayoría de los proveedores de Big Tech tienen una cláusula “tenemos sus datos durante 30 días para prevenir abusos” en sus Términos de Servicio)

Hay un montón de miedo que se acumula sobre los modelos de pesos abiertos (incluyendo los chinos) que ocurren ahora mismo porque las ganancias de los proveedores de Big Tech están en la línea si estos modelos continúan ofreciendo paridad de capacidades a una fracción del costo. No creas la hipa; los modelos de pesos abiertos son tan seguros que empresas como HuggingFace los han utilizado para hacer sus propias defensas de seguridad cibernética.

Tercero, donde tengo relaciones comerciales, las revelaré. Tengo un enlace afiliado de Amazon en el artículo de esta semana, y obviamente trabajo para mi empresa, Trust Insights. No tengo interés financiero en las otras empresas mencionadas en el momento de escribir. (pero estoy feliz de, llámame)

Parte 1: El modelo

Comenzaremos nuestro recorrido con qué modelo utilizar. En general, desea modelos que son una mezcla de costo eficiente con rendimiento efectivo. Uno de mis sitios favoritos para esto es el Análisis Artificial; hay una pequeña cuadrícula agradable en su página de modelos que muestra costo versus inteligencia. Lo que estamos buscando en esta red son modelos que están en la esquina superior izquierda - el eje vertical (y) es cerebros, donde más alto es mejor, y el eje horizontal (x) es coste, donde a la izquierda es menor.

El ganador actual es DeepSeek V4 Flash 0731, que tiene un costo muy bajo y un montón de cerebros, a la par con el nuevo modelo de OpenAI, GPT-5.6 Luna. A la derecha está Claude Opus 5, que tiene alrededor de 15% más cerebros pero 40x el costo. El peor cuadrante para estar en es el bajo derecho - alto costo, cerebros bajos.

Para los propósitos de construir el sistema agenteico más barato, DeepSeek va a ser su modelo de piloto diario.

Ahora, vale la pena señalar, como tengo en mi libro Casi sin tiempo: 48 Principios de la Fundación de la AI Generativa que un conductor diario puede no ser el modelo más inteligente, pero en términos de trabajo de día a día, un modelo como DeepSeek v4 Flash va a conseguir el trabajo hecho la mayor parte del tiempo. He aquí un poco de retrospectiva, por cierto, poniendo DeepSeek en la misma escala que todos los principales modelos de OpenAI a lo largo de los años para ver dónde se acumula en términos de cerebros.

DeepSeek V4 Flash supera todas las versiones más recientes de los modelos de OpenAI a lo largo de los años; es casi un 50% más inteligente que el modelo insignia del verano pasado, GPT-5, y es sólo un 17% menos capaz que el modelo insignia actual de OpenAI.

Aquí está el mismo gráfico del mundo Claude:

DeepSeek V4 Flash se trata de paridad con Claude Opus 4.7 - que salió en abril de 2026, un FOUR MONTHS AGO escaso.

Ahora, los tiempos cambian, los cambios tecnológicos, y lo que deberías estar haciendo es revisar estos tipos de gráficos con el tiempo para ver qué modelo está más cerca de esa esquina superior izquierda. Este mes, es DeepSeek V4 Flash. El próximo mes, podría ser completamente diferente. Es nuestra responsabilidad mantenernos al día con los gráficos y utilizar los cerebros más baratos y mejores que podemos conseguir.

Ahora que sabemos qué modelo pretendemos utilizar, tenemos que averiguar dónde utilizarlo.

Parte 2: El anfitrión

Al igual que las compañías de hospedaje web anfitriones, las compañías de alojamiento modelo - llamadas proveedores de inferencia - modelos de host. Hay tantos de estos ahí fuera, y compiten principalmente en dos cosas, velocidad y precio. Algunos proveedores cobran una prima pero generan resultados (tokens por segundo) a velocidades ridículas, como Cerebras. Otros ofrecen una amplia variedad de modelos a velocidades más lentas pero son baratos (como DeepInfra).

Elegir un proveedor es sencillo: porque ya has decidido el modelo, se trata de precios y disponibilidad. En Google AI Mode, modifique este aviso para satisfacer sus necesidades:

Ayúdame a crear una lista de proveedores de inferencias que coincidan con estos criterios. Primero y más importante, deben ofrecer este modelo exacto: {modelo}. Esto es inmutable y no negociable; un proveedor que no ofrece este modelo no hace la lista. En segundo lugar, identificar los precios de este modelo en tres categorías: costo por fichas de entrada, costo por fichas de salida, costo por fichas de caché. Si un proveedor no ofrece precios para este modelo para fichas de caché, descalificarlos. En tercer lugar, el proveedor debe ser un proveedor de inferencia de retención de datos cero (ZDR). Si los precios de ZDR son adicionales, computarlo como parte de los costos de ficha. La capacidad de ZDR es obligatoria; si un proveedor no ofrece ZDR, descalificarlos. Cuarto, si está disponible, obtener las fichas por segundo para este modelo para cada proveedor. Devuelve tus resultados como una lista ordenada en orden ascendente por costo más bajo por fichas para cada proveedor para nuestro modelo elegido.

Es posible que desee añadir necesidades adicionales específicas como el cumplimiento de SOC 2, el cumplimiento del RGPD, etc. Para el aviso basado en sus necesidades, así que personalizarlo de cualquier manera que desee.

Con cualquier modelo que elija, asegúrese de capturar el nombre completo del modelo; DeepSeek v4 Flash por ejemplo tiene un antecedente que carece del sufijo 0731. Nuestro modelo exacto que queremos es DeepSeek v4 Flash 0731.

Cuando meto esto en Google, DeepInfra, Fireworks AI y OpenCode Zen aparecen como buenas opciones. El que elijas se basará en cuánto priorizas la velocidad contra el costo. Si me dijiste que escoja uno y sólo uno, he sido cliente de DeepInfra por un par de años y no tengo ninguna queja en absoluto, pero también hay un caso para OpenCode Zen. Más en eso en un minuto.

Lo que me gusta, para el caso de uso específico de Leslie, es que pagar a medida que vas proveedores significa que no estás pagando si no estás usando la IA Y hay un fuerte incentivo económico para que uses IA lo menos posible y ser tan eficiente en su uso como sea posible. Uno de los problemas con los planes de token (que incluyen cosas como Claude Pro/Max, etc.) es que si no has alcanzado tus límites semanales/mestrales, estás perdiendo dinero - y por lo tanto eres más propenso a usar AI frívolamente. Con el pago mientras vas, solo pagas por lo que usas.

Parte 3: El Hardware

Para una segunda configuración informática que es barata, tenemos que pensar en cómo funcionan las computadoras. La interfaz gráfica de usuario a la que todos estamos acostumbrados en Windows o Mac o incluso Linux de escritorio, así como en nuestros teléfonos y tabletas, es un desperdicio ineficiente INCREDIBLE de recursos informáticos. Se necesitan enormes cantidades de memoria y poder de procesamiento para dibujar y mantener la interfaz en comparación con interfaces basadas en texto puro.

Ahora, el viejo y crujiente ordenador GenX en mí dice que todo el mundo debe saber cómo utilizar una interfaz basada en texto (a menudo llamada línea de comandos o un impulso de comando o terminal), pero eso no es realista. Sin embargo, hay un usuario que LOVES interfaces basadas en texto.

Sí, lo adivinaste. Eso es AI. AI es lejos, mucho más eficiente en escribir que está usando un ratón, por lo que para nuestro segundo equipo como Leslie preguntó, vamos a apuntar a una caja súper barata que puede ejecutar un terminal, almacenar cosas, y ejecutar un arnés AI. En un punto de precio de aproximadamente USD 500, no se ejecutarán modelos AI directamente en este hardware (de ahí por qué buscábamos proveedores de alojamiento en la Parte 2), pero tendrá una máquina decente con buen almacenamiento.

En el lugar de compras de su elección, busque lo que se llaman mini-PCs de juego. Estos suelen tener chips AMD Ryzen, un pequeño disco duro (normalmente 256 GB o 512 GB SSD), y entre 16 GB y 32 GB de RAM. La regla cardinal de la informática es que usted desea tanto RAM / memoria como el dinero puede comprar; un procesador ligeramente más lento con más RAM es mejor que un procesador rápido con RAM no suficiente. RAM es como carriles de carretera; un Bugatti atrapado en el tráfico en un solo camino de tierra de carril no va tan rápido como un Prius en una carretera de 8 carriles sin interferencia de tráfico.

Google AI El modo es útil aquí también. Modifique este aviso para satisfacer sus necesidades, especialmente si hay algunas empresas que prefiere no hacer negocios con:

Ayúdame a crear una lista de proveedores que ofrecen mini PCs de juego para la venta de ese barco a mi ubicación: {locale}. Mis criterios son que la máquina cuesta menos de {número} incluido del envío y que tiene un mínimo de 16 GB de RAM y 500 GB de espacio en disco, idealmente con un SSD. 32 GB de RAM es preferido, y más espacio de disco siempre es preferido. El sistema DEBE ser capaz de ejecutar Ubuntu Linux 26.06 en modo sin cabeza. La CPU puede ser cualquier marca o modelo que ofrezca una velocidad de reloj base de 3 GHz; AMD, Intel u otros proveedores están bien siempre y cuando estén completamente apoyados en Ubuntu. Ethernet y Wifi son obligatorios. Se prefiere USB-C, Bluetooth y HDMI. El soporte de eGPU es preferido. Se prefieren los siguientes proveedores y revendedores: {lista preferida}. Quedan prohibidos los siguientes proveedores y revendedores: {lista sellada} El caso de uso para este dispositivo será ejecutar OpenCode y Ubuntu Linux, además de aplicaciones como PostgreSQL, Docker, SQLite, Apache2, y sistemas similares de servidor para una sola persona. Arregle sus resultados en orden ascendente por precio como una lista ordenada.

Vi un ordenador chino aleatorio en Amazon que estaba vendiendo por USD 499…