AI почти готов заменить бухгалтеров, инженеров и юристов
OpenAI представил GDPval — набор из задач для 44 профессий; GPT‑5 и Claude Opus показывают почти паритет с экспертами и рост производительности более чем в 3 раза.
OpenAI представил GDPval — набор из задач для 44 профессий; GPT‑5 и Claude Opus показывают почти паритет с экспертами и рост производительности более чем в 3 раза.
Opus 4.5 лидирует в SWE‑bench, опережая Sonnet 4.5 в большинстве языков; улучшены reasoning, зрение и защита от prompt‑injection; введён параметр effort.
80B MoE-модель Qwen3‑Coder‑Next: 3B активных параметров, контекст 256K, локальный запуск (46 ГБ ОЗУ, 85 ГБ для 8‑бит). Модель на Hugging Face.
Анализ материала о том, почему громоздкие MCP‑сервера часто уступают минималистичным CLI/Bash и скриптам; пример скрапинга Hacker News.
Короткий разбор Claude Skills от Anthropic: как «папки с навыками» меняют подход к интеграции ИИ и чем они отличаются от MCP.
Краткая заметка о том, как Stack Overflow возвращается к продуктам с «AI» (OverflowAI, Question Assistant); ссылка на статью на Хабр.
Короткий обзор десктопного Codex от OpenAI: визуальный доступ к Skills, IDE‑фишки и бета‑планирование автоматизаций; временно открыт бесплатный доступ для Free и Go.
Claude Opus 4.6 от Anthropic: контекстное окно до 1 млн токенов, улучшения в агентном программировании и бенчмарках против GPT-5.2; доступно в Claude и RouterAI.
GPT-5.3‑Codex объединяет кодинг‑возможности и reasoning, работает ~25% быстрее и лучше держит контекст в длинных сессиях с инструментами.
Z.ai раскрыли детали GLM-5: 744B параметров, DeepSeek Sparse Attention, RL‑инфраструктура slime и лидерство на Vending Bench 2.
Новая флагманская модель GLM-5 появилась на chat.z.ai; подробностей пока нет, упоминают GLM-4.7 и ожидают бенчмарки.
Бесплатный вебинар Veai о проблемах AI‑ассистентов на больших кодовых базах; трансляция 12 февраля в 14:30 МСК. Ссылка на регистрацию в посте.
MiniMax представили M2.5: SOTA в программировании (SWE‑Bench 80,2%), +37% скорости и бесплатный 7‑дневный доступ в OpenCode.
OpenAI представила GPT‑5.3‑Codex Spark: более 1 000 токенов/с за счёт запуска на Cerebras; доступ в research preview для ChatGPT Pro (Codex app, CLI, VS Code).
Anthropic представили Claude Sonnet 4.6: контекстное окно 1M токенов (бета), преимущество в Claude Code и прежние тарифы $3/$15 за млн токенов.
Сравнение быстрого режима Anthropic (Opus 4.6, batch size) и OpenAI (GPT-5.3-Codex-Spark на Cerebras): скорость, ограничения памяти и практическая ценность.
Обзор Cursor 2.5: маркетплейс плагинов (Amplitude, AWS, Figma, Linear, Stripe), sandbox с allowlist и асинхронные субагенты — что изменилось.
Краткий разбор SkillsBench: 86 задач, 11 доменов, 7 308 прогонов — человеческие скиллы дают +16.2 п.п., автогенерация не помогает.
Anthropic проанализировали миллионы сессий Claude Code: рост длительности автономной работы до ≈45 минут, auto-approve ~20% у новичков и >40% у опытных.
OpenAI перестала применять SWE-bench Verified из‑за утечек ответов; рекомендован SWE-bench Pro. Anthropic обвиняет DeepSeek и др. в обучении на Claude без доказательств.