Artículos Relacionados con Código

El Centro de Noticias de HTX ofrece los artículos más recientes y un análisis profundo sobre "Código", cubriendo tendencias del mercado, actualizaciones de proyectos, desarrollos tecnológicos y políticas regulatorias en la industria de cripto.

Mírame 《El Señor de los Anillos》,Karpathy propone nuevo benchmark para evaluar modelos grandes

Andrej Karpathy, investigador de IA, ha propuesto un nuevo benchmark para evaluar modelos de lenguaje grandes: que generen una escena 3D interactiva a partir de la descripción textual del inicio de "El Señor de los Anillos". Este "benchmark del Señor de los Anillos" busca sustituir la popular prueba anterior de "un pelícano montando en bicicleta" en SVG, considerada ahora demasiado simple. El experimento usó el modelo Opus 5 de Anthropic y la biblioteca Three.js para JavaScript. Con la simple indicación del primer párrafo del libro, el modelo generó en aproximadamente 2 horas, usando 1 millón de tokens y 5500 líneas de código, un mundo 3D básico y funcione de la Comarca. Aunque el resultado visual es tosco y presenta errores como modelos flotantes, demuestra un avance significativo: la capacidad del modelo para planificar y ejecutar un proyecto complejo de código, comprendiendo relaciones espaciales y narrativas. Karpathy señala que esto expone una limitación actual: los modelos pueden generar mundos, pero aún no pueden "entrar" en ellos para comprenderlos visualmente o interactuar como un jugador. La comunidad ha respondido con creatividad, generando desde réplicas 3D de ciudades hasta conciertos virtuales, mostrando el potencial para reducir drásticamente la barrera de creación de prototipos 3D y juegos. El debate surge sobre si este método es un benchmark costoso pero revelador de la comprensión espacial y de planificación, o solo refleja un buen entrenamiento en Three.js. En cualquier caso, marca una evolución hacia evaluar la capacidad de los modelos para traducir comprensión abstracta en estructuras ejecutables complejas, más allá de generar una sola imagen o texto.

marsbit08/03 08:59

Mírame 《El Señor de los Anillos》,Karpathy propone nuevo benchmark para evaluar modelos grandes

marsbit08/03 08:59

OpenAI te enseña 8 trucos para dominar ChatGPT

**Resumen en español europeo del artículo:** OpenAI ha publicado una guía oficial con ocho técnicas clave para mejorar el uso de ChatGPT y obtener resultados más precisos. 1. **Usar el modelo más avanzado:** Siempre que sea posible, emplea el modelo más reciente (como el ficticio GPT-5.6 Sol del ejemplo) para un mejor rendimiento. 2. **Ser específico y detallado:** En lugar de instrucciones vagas, describe claramente el contenido, formato, estilo y longitud deseada de la respuesta. 3. **Estructurar el prompt:** Coloca la instrucción principal al principio y usa delimitadores como `###` o `"""` para separarla claramente del texto de entrada. 4. **Proporcionar ejemplos:** Muestra ejemplos del formato o respuesta que esperas para guiar al modelo de manera más efectiva. 5. **Empezar simple, luego agregar contexto:** Primero prueba con una instrucción simple (zero-shot), luego añade algunos ejemplos (few-shot) y solo como último recurso considera un ajuste fino (fine-tuning) con muchos datos. 6. **Evitar lenguaje vago:** Sustituye términos imprecisos como "unos pocos" por indicaciones concretas como "3-5 frases". 7. **Decir qué *sí* hacer, no solo qué *no*:** Además de indicar lo que ChatGPT debe evitar, especifica claramente la acción o comportamiento positivo que debe seguir. 8. **Usar palabras clave para código:** Al generar código, incluye palabras clave iniciales como `import` (Python) o `SELECT` (SQL) para guiar la estructura. Además, la guía menciona una función llamada "Generate Anything" que puede crear automáticamente prompts efectivos basados en una descripción general de la tarea. El objetivo final es comunicarse con ChatGPT de manera clara y estructurada para "domesticarlo" y aprovechar al máximo su potencial.

marsbit07/16 08:30

OpenAI te enseña 8 trucos para dominar ChatGPT

marsbit07/16 08:30

Claude se volvió 'tonto' en toda la red, y Anthropic aclara el motivo: No es el modelo quien te falla

**Los usuarios de Claude Code se quejaban de que el modelo se volvió más torpe, pero Anthropic aclara: el problema no era el modelo, sino el ajuste de "Esfuerzo".** En marzo, muchos desarrolladores notaron que Claude Code parecía menos competente: omitía leer archivos o ejecutar pruebas. La comunidad criticó fuertemente a Anthropic. La causa real fue un cambio en la configuración predeterminada del nivel de **Esfuerzo (Effort)**, de "alto" a "medio", realizado para reducir la latencia. Este ajuste afectó cuánto trabajo invertía Claude en una tarea, no su conocimiento fundamental. Anthropic explica la diferencia clave entre **Modelo** y **Esfuerzo**: * **Modelo (Sonnet, Opus, Fable):** Representa la "inteligencia" o conocimiento base del modelo (pesos congelados del entrenamiento). Cambiarlo resuelve problemas de "¿puede hacerlo?". * **Esfuerzo (Effort):** Representa la "actitud" o cuánto trabajo está dispuesto a realizar en una tarea específica (leer archivos, ejecutar pruebas, verificar). Un Esfuerzo bajo hace que Claude responda rápido pero pida más contexto; un Esfuerzo alto lo hace investigar y trabajar de forma más autónoma. **Conclusión importante:** Un modelo más pequeño (como Sonnet) con un Esfuerzo alto puede superar a un modelo más grande (como Opus) con un Esfuerzo bajo en muchas tareas. El cambio de marzo demostró que los usuarios a menudo subestimaban el impacto del control de Esfuerzo, culpando erróneamente al modelo. **Marco para solucionar problemas:** 1. Verifica primero el contexto y las instrucciones (prompt). 2. Si Claude se equivoca, pregúntate: **¿Es que "no sabe" o "no se esfuerza lo suficiente"?** * **No se esfuerza (ej., omite pasos):** Aumenta el nivel de Esfuerzo. * **No sabe (ej., errores persistentes a pesar del contexto):** Cambia a un modelo más capaz. La lección es que el uso efectivo de herramientas de IA como Claude Code ya no se trata solo de elegir el modelo más potente, sino de aprender a **gestionar y asignar recursos** (modelo y esfuerzo) de manera inteligente para cada tarea, optimizando tanto el rendimiento como el coste.

marsbit07/12 06:00

Claude se volvió 'tonto' en toda la red, y Anthropic aclara el motivo: No es el modelo quien te falla

marsbit07/12 06:00

Gemini 3.5 Pro se filtra en secreto, superando a Fable 5 en frontend

**Gemini 3.5 Pro: Filtraciones revelan su capacidad superior en generación de código front-end, superando a Fable 5** Tras dos meses de espera, las filtraciones apuntan a que Gemini 3.5 Pro, el modelo estrella de Google, podría lanzarse el 17 de julio. Lo más destacado es su aparente salto de capacidad en la generación visual y de código para front-end, donde según pruebas de desarrolladores superaría a Fable 5. Sus mejoras clave incluyen: un mejor criterio de diseño (colores, espaciado), interfaces de usuario más limpias y con menos código redundante, una generación de SVG significativamente más precisa y capaz, y una mayor completitud en la creación de páginas con una sola instrucción. Ejemplos mostrados generan desde retratos en SVG complejos hasta una isla flotante estilo steampunk con Three.js, todo a partir de descripciones breves. Sin embargo, el modelo no sería superior en todas las áreas. En tareas de razonamiento complejo, ingeniería de software a gran escala (nivel repositorio) o ejecución de agentes de larga duración, las filtraciones indican que aún estaría por detrás de Fable 5 y GPT-5.6. La demora en su lanzamiento se atribuiría a que Google no solo amplió el modelo, sino que realizó un nuevo preentrenamiento desde una base diferente a la de Gemini 3.5 Flash. Este nuevo "cimiento" también serviría para 'Nano Banana Pro', un futuro modelo de generación de imágenes que competiría con GPT-Image 2. La posible llegada de Gemini 3.5 Pro marca un intento de Google por recuperar terreno en la intensa competencia de modelos de IA, centrando su fortaleza en un ámbito específico mientras trabaja para igualar a sus rivales en otros frentes. La comunidad espera la confirmación oficial para el 17 de julio.

marsbit07/06 12:30

Gemini 3.5 Pro se filtra en secreto, superando a Fable 5 en frontend

marsbit07/06 12:30

1600 líneas de código construyen un Manhattan submarino, Fable 5 deja boquiabierto a Karpathy

**Resumen: Fable 5 genera mundos 3D sorprendentes con un código mínimo** El modelo Fable 5, tras su relanzamiento, ha demostrado capacidades extraordinarias para la generación de mundos 3D interactivos y complejos a partir de especificaciones detalladas. El evaluador Peter Gostev de Arena.ai creó 63 mundos en video, la mayoría en una sola pasada, impresionando incluso a expertos como Andrej Karpathy de Anthropic. Entre los ejemplos más destacados se encuentra una "Manhattan submarina" completa, generada con solo 1600 líneas de código, que muestra un nivel de detalle asombroso en edificios y calles. Otros incluyen recreaciones 3D navegables de obras de arte como *La noche estrellada* de Van Gogh y *Los nenúfares* de Monet, paisajes naturales dinámicos (como un oso atrapando un salmón), ciudades históricas y escenarios de ciencia ficción. Gostev señala que el verdadero avance no es la belleza de escenas individuales, sino la capacidad del modelo para coordinar una gran cantidad de elementos de manera coherente, reduciendo drásticamente el tiempo de depuración necesario. Sin embargo, también reconoce limitaciones actuales, como la creación de juegos profundos y cierta tendencia del modelo a "conformarse" si no se le presiona para ser más ambicioso. Karpathy reflexionó sobre cómo el modelo, entrenado solo con datos de Internet, parece haber inferido conocimientos del mundo real (como el comportamiento de un pez atrapado) y los traduce efectivamente a componentes 3D. Tanto él como Gostev coinciden en que el potencial de esta tecnología está lejos de ser completamente explorado y que su rápido desarrollo abre nuevas posibilidades creativas y prácticas.

marsbit07/06 09:51

1600 líneas de código construyen un Manhattan submarino, Fable 5 deja boquiabierto a Karpathy

marsbit07/06 09:51

Confirmado: Claude Code espía a los usuarios, la zona horaria y los laboratorios de IA chinos son palabras clave

Anthropic experimenta un día de contrastes: mientras anuncia la liberación de las restricciones de exportación estadounidenses para sus modelos Claude Fable 5 y Mythos 5, se enfrenta a una polémica por prácticas de seguimiento encubiertas en su herramienta Claude Code. Una investigación revela que Claude Code incorporaba un mecanismo oculto que detectaba automáticamente si los usuarios configuraban un proxy personalizado (verificando la variable ANTHROPIC_BASE_URL) y comprobaba su zona horaria, especialmente si estaba configurada en Asia/Shanghái o Asia/Ürümqi. Esta información, junto con la posible detección de conexiones a dominios asociados con laboratorios de IA chinos (como Baidu, Alibaba o ByteDance), se codificaba de forma encubierta (esteganografía) en el prompt del sistema enviado a los servidores de Anthropic. La marca se realizaba mediante sutiles variaciones en caracteres Unicode, como cambiar el apóstrofo en "Today's date" o usar barras inclinadas en lugar de guiones en la fecha, haciéndola prácticamente indetectable para el usuario. La comunidad de desarrolladores ha criticado esta práctica por vulnerar la transparencia y la confianza esenciales en una herramienta con acceso a código y permisos de ejecución. Aunque la telemetría para prevenir abusos es común, su implementación encubierta en el prompt del sistema plantea serias dudas éticas. Tras la exposición, un miembro del equipo de Anthropic confirmó que el código responsable sería eliminado en una próxima actualización.

marsbit07/01 03:47

Confirmado: Claude Code espía a los usuarios, la zona horaria y los laboratorios de IA chinos son palabras clave

marsbit07/01 03:47

活动图片