Восемь ответов из двенадцати получили ноль на первом же прогоне. Причина у всех одна и та же: конкретные цифры рынка, оценки спроса и обещанный рост записи — при том что задание прямо запрещало их выдумывать.
Тему я выбирал по одному признаку: в ней одинаково плохо проходят и фантазия, и обтекаемость. Медицинский сайт в Дубае — это многоязычная аудитория, страницы врачей и оборудования, лицензии и осторожные формулировки. Гладкий текст такую задачу не закрывает, а выдуманный рынок в ней стоит дороже, чем в доставке пиццы.
Версии моделей привязаны к дате прогона — 16 марта 2026 года. Там, где провайдер явно раскрывал номер версии, речь шла, например, о GPT-5.4, Claude Sonnet 4.6 и DeepSeek-V3.2. В остальных случаях использовались текущие на ту дату версии внутри соответствующих интерфейсов.
Что именно тестировалось
Тест мерил одно: способность модели собрать полноценную стратегию для медицинского сайта в Дубае с учётом услуг, страниц врачей, локального спроса, доверия и коммерческой воронки. Красивый текст здесь не засчитывался.
Хороший ответ должен был раскрыть архитектуру сайта, приоритет страниц услуг, логику страниц врача и технологии, блоки доверия, контентные кластеры, сценарии записи, многоязычность, локальную видимость и риски в чувствительной тематике.
Плохой ответ выглядел иначе. Он либо расплывался в общих советах, либо начинал изображать исследование рынка, не имея права на такую уверенность. Именно в этом разрыве и проявилась разница между моделями.
Что считалось обязательным в ответе
Структура услуг, страницы врачей, страницы технологий, консультационные разделы, конверсионные маршруты и внутренние связи между ними.
Документы, лицензии, сертификаты, опыт врачей, объяснения кандидату на процедуру, послеоперационные ожидания и нейтральный медицинский тон.
Пакеты услуг, посадочные страницы под запись, локальная логика спроса, страницы цены и удобный путь от запроса к заявке.
Отсутствие опасных обещаний результата, отсутствие недоказанных цифр и чёткое разделение факта, гипотезы и допущения.
Промт, который получили все нейросети
Все эти требования стояли в самом задании, а не подразумевались. Один и тот же промт для SEO медицинской клиники получили все 12 моделей: без примеров, без подсказок и без подгонки под конкретную систему. Вот он целиком — заберите под свою клинику и подставьте свой город вместо Дубая.
Роль: ты SEO-стратег для частной медицинской клиники. Контекст: сайт клиники в Дубае (ОАЭ). Несколько направлений услуг, страницы врачей, страницы технологий и оборудования, многоязычная аудитория — английский, арабский, русский. Задача: собери стратегию SEO и структуру сайта, которая ведёт пациента от запроса к записи. Раскрой в ответе: 1. Архитектуру: разделы услуг, страницы врачей, страницы технологий, консультационные и ценовые страницы, внутренние связи между ними. 2. Блоки доверия: лицензии, сертификаты, опыт врачей, объяснения кандидату на процедуру, послеоперационные ожидания. Тон нейтральный, медицинский. 3. Локальный контекст: логику спроса в Дубае и ОАЭ, многоязычность, особенности аудитории. 4. Коммерческую воронку: пакеты услуг, посадочные под запись, страницы цены, путь от первого запроса до заявки. 5. Контентные кластеры под услуги и под реальные вопросы пациентов. Жёсткие ограничения: — не придумывай объём рынка, темпы роста, поисковый спрос и уровень конкуренции; если данных нет, прямо так и напиши; — не обещай результат лечения и не давай рост записи в цифрах; — разделяй факт, гипотезу и допущение; — держи структуру: каждый блок отдельно, без расплывания в общие советы.
Дальше ответы проходили две проверки, и у каждой был свой промт. Первый оценивал внутреннюю дисциплину: держит ли модель структуру и не выдумывает ли цифры. Второй отделял плохо оформленную, но верную мысль от фантазии про рынок. Их тоже можно забрать.
Оцени ответ модели по SEO-стратегии медицинской клиники. Шкала 0–100. Считай только то, что есть внутри ответа. Внешние источники не подставляй. Авто-провал (итог = 0), если есть хотя бы одно: — конкретные цифры рынка, спроса или роста записи без опоры внутри документа; — опасные медицинские обещания результата; — сломанный формат: пропущены обязательные блоки, таблицы, приоритеты. Если авто-провала нет, оценивай по четырём осям: — архитектура и полнота структуры — 0–30; — блоки доверия и медицинская аккуратность — 0–30; — локализация под Дубай и многоязычность — 0–20; — коммерческая логика и путь к записи — 0–20. Дай балл по каждой оси, итог и одну ключевую причину.
Перед тобой спорные утверждения из ответа модели: рыночные оценки, числа, эффекты роста. Для каждого реши: это плохо оформленная, но в принципе верная мысль — или фантазия без опоры. Для каждого утверждения верни: — проверяемо ли оно в принципе; — подтверждается ли публичными данными; — вердикт: подтверждено / не подтверждено / требует данных клиента. Не засчитывай утверждение как верное только потому, что оно звучит убедительно.
Кто выставлял баллы, важно проговорить прямо. Оба оценочных промта прогонял я сам в отдельной сессии, а финальное решение по каждому ответу подтверждал вручную по этой же рубрике. Отдельной модели-судьи и слепого к названию модели протокола здесь не было: я видел, какой ответ чей, и это влияет на субъективность оценки. Поэтому все баллы стоит читать как мою структурированную экспертную оценку по единой шкале, а не как лабораторный замер с независимым арбитром.
Разделение на два прохода нужно как раз потому, что убедительный на вид документ в медицинской теме опаснее очевидно слабого: его несут в работу целиком, вместе с придуманными числами.
Почему эта задача намного сложнее обычного SEO-запроса
В обычной статье про продвижение модели могут долго держаться на общих советах. В медицинской теме это не работает. Здесь важны и доверие, и экспертность, и локальный контекст Дубая, и реальная логика страниц, которые приводят пациента к записи.
Провалить такую задачу можно с двух сторон. Модель либо выдумывает рынок и пропускает блоки доверия, либо страхуется общими словами и не доходит до конкретных страниц. Оба исхода дают документ, который нельзя отдать в работу.
У Google для таких тем отдельная планка. В руководстве Search Central медицина попадает в категорию Your Money or Your Life, куда относят темы, способные заметно повлиять на здоровье, финансовую стабильность или безопасность людей. К таким страницам требования по E-E-A-T выше, чем к обычным. Нейросеть об этом не знает и пишет про клинику так же, как про доставку пиццы.
Отсюда и выбор темы для проверки: здесь одна гладкость ответа ничего не даёт. Модели приходится одновременно держать структуру, локальный контекст, доверие и осторожность формулировок — а срывается она обычно на одном из четырёх.
Сравнение нейросетей: какие ИИ участвовали
В список я взял и самые обсуждаемые модели, и несколько менее популярных систем, которые иногда выстреливают на прикладных задачах. Репрезентативной выборкой это не делает: двенадцать участников на одном промте показывают конкретный срез, а не расстановку сил на рынке.
| Модель | Первое впечатление | Что бросалось в глаза | Стартовый риск |
|---|---|---|---|
| ChatGPT | Собранный и прикладной | Сильная привязка к реальности сайта, доверие, страницы услуг | Умеренный |
| Claude Sonnet 4.6 | Очень мощный по размаху | Сильная архитектура адресов и подробный план запуска | Высокий |
| Kimi | Коммерчески заряженный | Пакеты, цены, продуктовая логика, языковая упаковка | Высокий |
| Meta | Ровный и понятный | Хорошо объясняет стратегию языком руководителя | Умеренный |
| MiniMax | Практичный и сухой | Напоминает про запись, чат, обратный звонок и воронку | Умеренный |
| Gemini | Идеи есть, дисциплины меньше | Страницы технологий и связка врача с оборудованием | Высокий |
| DeepSeek | Человечный и психологичный | Снятие страхов пациента и спокойный язык доверия | Высокий |
| Grok 4 | Смелый и энергичный | Удержание, сопровождение, повторные касания | Критичный |
| Grok 4.2 arena | Компактный, но дерзкий | Неплохая дифференциация, но слабая доказательность | Высокий |
| HuggingFace Kimi-K2 | Интересные углы | Культурные подсказки и длинные хвосты | Критичный |
| Mistral | Местами полезный | Темы про безопасность и хвостовые вопросы | Высокий |
| Copilot | Слишком тонкий ответ | Мало глубины, мало структуры, мало пользы | Критичный |
Первый этап: внутреннее строгое судейство
Первый этап отвечал на вопрос, насколько модель умеет держать дисциплину сама по себе. Здесь я не спасал её внешними источниками. Я смотрел только на то, что она сама принесла в ответ.
Если модель давала точные цифры рынка, обещала рост записи или рисовала количественную картину спроса без чёткой опоры внутри документа — такой ответ получал дисквалификацию, а не высокий балл.
| Модель | Сырой балл | Итог этапа 1 | Статус | Ключевая причина |
|---|---|---|---|---|
| ChatGPT | 88 | 88 | PASS | Лучший баланс структуры, доверия и пригодности к внедрению |
| Meta | 74 | 74 | BORDERLINE | Ровный документ, но слишком обобщённый на уровне архитектуры |
| MiniMax | 63 | 63 | WEAK | Полезен для конверсии, но слабее в стратегии и глубине |
| Gemini | 55 | 55 | FAIL | Несколько сильных идей не компенсировали структурную слабость |
| Claude Sonnet 4.6 | 91 | 0 | AUTO-FAIL | Слишком уверенные рыночные данные без внутренней защиты |
| Kimi | 83 | 0 | AUTO-FAIL | Сильная коммерция, но перегрузка неподтверждёнными цифрами |
| Grok 4 | 76 | 0 | AUTO-FAIL | Слишком смелые обещания эффекта и роста конверсии |
| DeepSeek | 72 | 0 | AUTO-FAIL | Сильный психологический слой, но слабее фактологическая устойчивость |
| Grok 4.2 arena | 69 | 0 | AUTO-FAIL | Недостаточно дисциплины в выводах и оценках |
| HuggingFace Kimi-K2 | 58 | 0 | AUTO-FAIL | Культурные и регуляторные выводы оказались слишком смелыми |
| Mistral | 52 | 0 | AUTO-FAIL | Не дотянул по полноте и практической применимости |
| Copilot | 21 | 0 | AUTO-FAIL | В этом прогоне ответ вышел слишком коротким и поверхностным |
Типовые ошибки ИИ в медицинском SEO
Провалы разложились на два типа: самоуверенность и банальность. Третьего в этих двенадцати ответах почти не встретилось.
Самоуверенность проявлялась в цифрах. Модели говорили про рынок, темпы роста, поисковый спрос, конкурентность и рост записи так, будто только что вышли из закрытого аналитического кабинета.
Банальность проявлялась в другом. Ответ звучал аккуратно, но был слишком похож на шаблонную заметку про локальное SEO, блог и экспертность без реальной глубины по структуре сайта.
Пять системных провалов, которые встречались чаще всего
Самая опасная ошибка. Особенно часто это были объём рынка, темпы роста, поисковый спрос, оценка конкуренции и обещания роста записи.
Многие модели писали о контенте и локальном SEO, но плохо раскладывали страницы услуг, врачей и конверсионные блоки.
Опасные обещания эффекта, небрежные медицинские формулировки и избыточная уверенность там, где нужна аккуратность.
Ряд ответов звучал так, будто их писали для любого города мира. Контекст ОАЭ и логика локального спроса раскрывались слабо.
Часть моделей теряла обязательные таблицы, финальные блоки, приоритеты и ключевые конверсионные страницы.
Кто выглядел сильно, но провалился
Часть ответов на старте выглядела как готовые победители — объём, структура, уверенный тон. Рубрика сняла с них ровно то, что производило впечатление.
Claude Sonnet 4.6
Самый впечатляющий по архитектуре и глубине документ. На первом этапе сгорел из-за слишком уверенных рыночных тезисов и численных оценок.
Kimi
Сильный коммерческий слой. Но желание выглядеть более деловым и убедительным привело к перегрузке неподтверждёнными цифрами.
Grok 4
Дал хорошие идеи по удержанию и сопровождению после процедуры. Проблема в том, что часть эффектов роста записи была сформулирована слишком смело.
Второй этап: отдельный фактчекинг
Авто-провал на первом этапе означает нарушение правил задания, а не ложность утверждения. Модель могла назвать цифру, которая в реальности верна, — но не имела права называть её без опоры внутри документа. Поэтому спорные тезисы ушли на второй проход, где проверялась уже фактическая сторона.
Два этапа меряют разное: первый — внутреннюю дисциплину ответа, второй — устойчивость его утверждений к внешней проверке. Модель может провалить первый и пройти второй, и наоборот.
| Модель | Итог этапа 2 | Статус | Что изменилось |
|---|---|---|---|
| Claude Sonnet 4.6 | 90 | PASS | Ключевые рыночные тезисы получили внешнюю опору |
| ChatGPT | 88 | PASS | Почти без изменений, потому что и так был дисциплинирован |
| Kimi | 81 | PASS | Часть коммерческих и рыночных тезисов подтвердилась |
| Meta | 74 | BORDERLINE | Сильный середняк, но без резкого роста после проверки |
| MiniMax | 63 | WEAK | Сохранил пользу, но не вырос по стратегии |
| Gemini | 55 | FAIL | Отдельные удачные идеи не вытянули ответ целиком |
| Grok 4 | 0 | AUTO-FAIL | Эффекты роста записи и конверсии не подтвердились |
| DeepSeek | 0 | AUTO-FAIL | Часть спорных утверждений осталась без надёжной защиты |
| Grok 4.2 arena | 0 | AUTO-FAIL | Не хватило фактологической устойчивости |
| HuggingFace Kimi-K2 | 0 | AUTO-FAIL | Регуляторные и рыночные тезисы не подтвердились |
| Mistral | 0 | AUTO-FAIL | Не спасся из-за слабой полноты и низкой практической ценности |
| Copilot | 0 | AUTO-FAIL | Слишком бедный ответ, подтверждать там было почти нечего |
Как изменился рейтинг после проверки фактов
После второго этапа особенно интересно было не только новое место модели, но и направление движения. Кто-то сохранил позицию. Кто-то резко вырос. А кто-то окончательно подтвердил, что яркая форма не заменяет надёжность.
| Модель | Этап 1 | Этап 2 | Сдвиг | Почему |
|---|---|---|---|---|
| Claude Sonnet 4.6 | AUTO-FAIL | 1 место | Резкий рост | Сильная стратегия получила внешнюю фактологическую защиту |
| ChatGPT | 1 место | 2 место | Почти без изменений | Изначально писал аккуратнее остальных и не нуждался в спасении |
| Kimi | AUTO-FAIL | 3 место | Сильный рост | Коммерческие идеи оказались лучше, чем выглядели в строгом режиме |
| Meta | 2 место | 4 место | Легкое снижение | Стабильный, но менее мощный документ на фоне реабилитированных лидеров |
| MiniMax | 3 место | 5 место | Легкое снижение | Полезен операционно, но проигрывает стратегически |
| Остальные | Ниже прохода | Ниже прохода | Без разворота | Либо слабая полнота, либо спорные тезисы так и не удалось защитить |
Кто победил по разным режимам оценки
Если задавать вопрос слишком общо, ответ почти всегда будет ложным. У этого теста три разных победителя в зависимости от того, какой режим оценки вам важен.
Три победителя в трех логиках оценки
Берите ChatGPT как основу. Он не самый эффектный по подаче, зато самый дисциплинированный и устойчивый к жёсткому чтению.
Claude даёт самый детальный каркас разделов и порядка запуска. Отдельный проход по спорным местам обязателен: без него документ уходит в работу вместе с непроверенными числами.
Kimi хорошо раскрывает упаковку услуг, ценовые уровни и продуктовую логику, но требует строгой фильтрации численных выводов.
Финальная таблица после второго этапа
После внешней проверки фактов расклад стал окончательнее. Ниже собрана полная сводка по всем моделям: итоговый балл второго этапа, статус и причина, по которой модель заняла именно это место.
| Место | Модель | Скор | Статус | Почему здесь |
|---|---|---|---|---|
| 1 | Claude Sonnet 4.6 | 90 | PASS | Самый сильный по архитектуре и масштабу документ после того, как спорные рыночные тезисы получили внешнюю опору. |
| 2 | ChatGPT | 88 | PASS | Самый устойчивый по внутренней дисциплине и самый надёжный как базовый рабочий документ без лишнего риска. |
| 3 | Kimi | 81 | PASS | Сильно раскрыл коммерческую сторону задачи, но всё равно уступил лидерам по общей строгости и надёжности. |
| 4 | Meta | 74 | BORDERLINE | Ровный и понятный документ без крупных провалов, но менее глубокий и менее сильный архитектурно. |
| 5 | MiniMax | 63 | WEAK | Полезен операционно и конверсионно, но проигрывает по стратегической глубине и полноте. |
| 6 | Gemini | 55 | FAIL | Дал несколько хороших идей по технологиям и врачу, но не собрал достаточно сильный документ целиком. |
| 7 | Grok 4 | 0 | AUTO-FAIL | Сильные мысли про удержание не спасли ответ, потому что спорные эффекты роста и конверсии не подтвердились. |
| 8 | DeepSeek | 0 | AUTO-FAIL | Хорошо работал со страхами пациента, но часть спорных утверждений осталась без надёжной фактологической опоры. |
| 9 | Grok 4.2 arena | 0 | AUTO-FAIL | Компактный и местами интересный ответ, но слишком слабый по дисциплине и устойчивости выводов. |
| 10 | HuggingFace Kimi-K2 | 0 | AUTO-FAIL | Дал небесполезные культурные углы, но не выдержал проверку регуляторных и рыночных утверждений. |
| 11 | Mistral | 0 | AUTO-FAIL | Отдельные идеи были пригодны, но итоговый документ оказался слишком слабым и неполным для прохода. |
| 12 | Copilot | 0 | AUTO-FAIL | В этом единичном прогоне ответ вышел слишком коротким и поверхностным: материала для полноценной конкуренции просто не хватило. |
Уникальные сильные стороны каждой ИИ
Модели из нижней половины зачёта всё же дали отдельные пригодные куски. На этом и построена сборка ниже: общий балл отвечает за надёжность документа целиком, а отдельный сильный блок можно взять и у аутсайдера.
| Модель | Уникальная сила | Что именно расширяет | Скор уникального вклада |
|---|---|---|---|
| Claude Sonnet 4.6 | Архитектура страниц и план запуска | Логика адресов, очередность вывода разделов, консультационные страницы | 95 |
| ChatGPT | Аудит доверия и реалистичность | Документы, лицензии, врачи, кандидаты на процедуру, блоки доверия | 93 |
| DeepSeek | Снятие страхов пациента | Психология выбора, возражения, тревоги, безопасный язык объяснений | 82 |
| Kimi | Коммерческая упаковка | Пакеты, уровни услуг, страницы цены и сценарии апсейла | 80 |
| Meta | Понятное объяснение стратегии | Подходит для собственника и руководителя, когда нужен не технарский, а управленческий язык | 78 |
| Grok 4 | Удержание и сопровождение | После процедуры, повторные касания, напоминания, программы лояльности | 77 |
| Gemini | Страницы оборудования и брендов врачей | Контент вокруг аппаратов, технологий и экспертности врача | 74 |
| MiniMax | Прикладная конверсия | Чат, запись, обратный звонок, маршрут клиента до лида | 72 |
| Grok 4.2 arena | Короткая дифференциация | Подсказывает, чем клиника может отличаться на фоне рынка | 69 |
| HuggingFace Kimi-K2 | Культурные и языковые углы | Часть идей по микролокализации и длинным хвостам была небесполезной | 67 |
| Mistral | Вопросы доверия | Подсказал несколько хороших хвостовых тем про безопасность и ожидания | 65 |
| Copilot | Краткость | Полезен только как короткий исполнительный абзац, но не как стратегия | 34 |
Как был собран эталонный сборный ответ
Лучший итоговый документ получился не из одной модели. Он получился из аккуратной сборки сильных сторон, но только после того, как были вычищены спорные цифры, лишняя риторика и недоказанные эффекты роста.
ChatGPT отвечал за аудит доверия и реалистичность. Claude давал архитектуру страниц и порядок внедрения. DeepSeek усиливал слой снятия страхов. Kimi добавлял коммерческую упаковку. Grok 4 помогал идеями по удержанию после процедуры. Meta переводил стратегию на язык собственника. Gemini подсказывал логику страниц технологий и оборудования. MiniMax напоминал не забыть про путь к записи.
Каркас стратегии
- Взять ChatGPT как базовый слой доверия и прикладной структуры.
- Добавить архитектурный каркас Claude для разделов, адресов и очередности вывода.
- Сразу убрать все спорные числовые утверждения, которые нельзя защитить.
Расширение ценности
- Вшить страхи пациента и объяснительные блоки от DeepSeek.
- Добавить коммерческие уровни услуг, страницы цен и наборы предложений из Kimi.
- Включить сценарии сопровождения и повторного обращения из Grok 4.
Готовность к внедрению
- Перевести документ на язык собственника через рамку Meta.
- Усилить страницы оборудования и врачей идеями Gemini.
- Довести конверсионные механики через MiniMax и ручную редактуру.
| Слой эталонного ответа | Лучшая модель | Зачем брать |
|---|---|---|
| Доверие, лицензии, страницы врачей | ChatGPT | Самый надёжный базовый слой для медицинского сайта |
| Архитектура разделов и адресов | Claude Sonnet 4.6 | Лучше всех строит карту страниц и порядок запуска |
| Снятие тревоги и работа с возражениями | DeepSeek | Хорошо переводит стратегию в язык пациента |
| Коммерческая упаковка и ценовые уровни | Kimi | Расширяет ответ в сторону денег и продуктовой логики |
| Сопровождение после процедуры и удержание | Grok 4 | Добавляет идеи, которых почти не было у других моделей |
| Язык для собственника и руководителя | Meta | Упрощает сложную стратегию без сильной потери смысла |
| Страницы технологий и бренда врача | Gemini | Даёт полезные углы вокруг оборудования и экспертности |
| Запись, чат, обратный звонок | MiniMax | Напоминает, что SEO без пути к заявке неполноценно |
Что этот тест реально показывает SEO-специалисту и бизнесу
Гладкость ответа не годится как критерий выбора. Восемь провалившихся ответов читались нормально; вылетели они на цифрах, которых не должно было быть. Увидеть это можно, только читая ответ по заранее написанной рубрике, а не по общему впечатлению.
Чувствительная ниша при этом работает как усилитель: слабость модели вылезает в первых же блоках, потому что промахи здесь заметнее. Для более простых тем это означает, что провал будет не мягче — просто вы его дольше не увидите.
Практический порядок из этого один: базовая модель для дисциплины, вторая для архитектуры, отдельный проход по спорным числам и редактура человеком, который понимает и продвижение, и риски темы. Одна модель без этой обвязки в двенадцати ответах документ до внедряемого состояния не довела ни разу.
Сам факт генерации санкций не вызывает. Google сформулировал позицию ещё в феврале 2023 года и награждает качественный контент независимо от способа производства. Проблема начинается на масштабе: в спам-политиках злоупотреблением названо создание множества страниц генеративными инструментами без добавления ценности для пользователя. Яндекс формулирует короче и относит к некачественным сайты с автоматически сгенерированным и бесполезным для пользователя контентом. Разница между рабочим текстом и спамом лежит не в инструменте, а в том, что вы добавили после генерации.
Отдельный слой этой системы — не только качество ответа модели, но и то, кого сами модели готовы цитировать и рекомендовать. Эту часть я отдельно разобрал в статье про AI visibility в ChatGPT, Perplexity и AI-поиске.
Используйте ИИ как многослойный инструмент, а не как кнопку
Одна модель может лучше строить структуру, другая лучше работает с доверием, третья лучше добавляет коммерческую логику. Собирать итог надо осознанно.
Для чувствительных тем нужна своя рубрика оценки
Обычные критерии качества текста здесь бесполезны. Нужны штрафы за фантазии про рынок, за опасные формулировки и за отсутствие блоков доверия. Готовый ориентир для такой рубрики Google публикует сам, в руководстве для оценщиков качества поиска, где YMYL-темы разбираются отдельным разделом.
Разделяйте внутреннюю дисциплину и внешнюю истинность
Это была главная методологическая находка эксперимента. Одна и та же модель может плохо оформить фактологию, но оказаться сильной после проверки.
Не позволяйте ИИ придумывать деньги и спрос
Как только в ответе появляются конкретные рыночные цифры, объёмы поискового спроса и ожидаемые приросты записи, включается другой режим проверки. Без этого нельзя.
Собрать такую систему под конкретный сайт — это уже отдельная работа: строгая рубрика, проверка ответов и доведение сырого ИИ-материала до внедряемой стратегии. Как я это делаю на проектах, описано на странице услуг: техаудит и SEO-стратегия.
Ограничения эксперимента
Этот тест получился жёстким, но у него всё равно есть границы. Он показывает, насколько хорошо модели справляются с одной сложной стратегической задачей, но не претендует на абсолютный приговор по всем сценариям использования.
Я не сравнивал скорость ответа, стоимость работы, удобство интерфейса и стабильность в длинном диалоге. Фокус был уже: качество стратегического мышления, аккуратность формулировок, глубина структуры и устойчивость к проверке фактов.
Что важно помнить при интерпретации результатов
Модели проверялись на медицинской стратегии для сайта в Дубае. В других тематиках и форматах расстановка сил может отличаться.
Эксперимент не отвечал на вопрос, кто пишет быстрее или дешевле. Он отвечал на вопрос, кто мыслит надёжнее в сложной теме.
Я оценивал качество документов и логики, а не фактический рост трафика или заявок после реального запуска стратегии.
Даже лучший результат в этом тесте не означает, что модель можно отпускать в автономное плавание без редактора и специалиста.
Grok 4.2 arena и HuggingFace Kimi-K2 я получал через арена и сторонний интерфейс, а не через нативный продукт. Там могли отличаться системный промт и параметры генерации, поэтому их результаты строго сопоставимы с остальными десятью моделями с оговоркой.
Короткая итоговая выжимка
Если совсем коротко
ChatGPT. Он дал самый надёжный документ без необходимости спасать его внешней проверкой.
Claude. После фактчекинга его каркас оказался самым проработанным по архитектуре и порядку внедрения.
Kimi. Но только при жёсткой фильтрации численных обещаний и спорных рыночных выводов.
Это один прогон одного промта, оценённый мной без слепого протокола. Порядок мест переносить на другие задачи нельзя, воспроизводить рубрику — можно.
Быстрые ответы на частые вопросы
Один промт на SEO-стратегию для медицинской клиники в Дубае: архитектура, страницы врачей, блоки доверия, локализация и путь к записи, с прямым запретом выдумывать цифры рынка. Полный текст промта — в разделе «Промт, который получили все нейросети».
По общему балансу лучше всего показал себя ChatGPT. По мощности итогового документа после внешней проверки лидировал Claude.
На первом этапе победил ChatGPT. После фактчекинга первое место занял Claude. Если нужен самый безопасный фундамент, снова выигрывает ChatGPT.
Потому что она быстро наказывает и пустоту, и самоуверенность: выдуманная цифра рынка и обещание результата видны сразу. В нейтральной теме те же дефекты остаются незамеченными дольше.
Нет. В такой теме нужна обязательная ручная фильтрация, проверка фактов и доработка стратегии человеком, который понимает и продвижение, и риски ниши.
Отдельный вопрос — требование заказчика «0% AI» на такой текст. Проверять его нечем: в отдельном исследовании AI-детекторов вердикт переворачивался от одного форматирования, без единой правки в тексте.
Чем модели различаются вне медицинской ниши, показывает сравнение восемнадцати сервисов, а что стоит за самой метрикой машинности — разбор перплексии на русском тексте.
Что с этим делать
Начните с ChatGPT: в этом прогоне он дал документ, который не пришлось спасать внешней проверкой. Архитектуру и порядок внедрения возьмите у Claude, но заложите отдельный проход по числам — именно на них он вылетел на первом этапе. Сборку из нескольких моделей имеет смысл затевать, только если есть кому вычистить спорные цифры: без этого шага она даёт объём, а не надёжность. Как такая система разворачивается на проектах, показываю в гайде про LLM-подход в B2B SEO.
Часто задаваемые вопросы
По общему балансу лучшей базой в эксперименте стал ChatGPT. По силе итогового документа после внешней проверки спорных тезисов первое место занял Claude.
На первом этапе победил ChatGPT за счёт более строгой внутренней дисциплины. После фактчекинга первое место занял Claude, но по общему балансу самым надёжным остался ChatGPT.
Медицинское SEO относится к YMYL-среде. Здесь быстро вскрываются опасные обещания, выдуманные цифры, слабая локализация и отсутствие блоков доверия.
Нет. В медицинской нише ответ ИИ требует обязательной фильтрации, проверки спорных фактов и ручной доработки стратегии специалистом.
Все 12 моделей получили один промт на SEO-стратегию для медицинской клиники в Дубае: архитектура сайта, страницы врачей и услуг, блоки доверия, локализация под ОАЭ и путь к записи. Промт прямо запрещал выдумывать цифры рынка и обещать результат лечения. Ответы затем проходили два оценочных промта: проверку внутренней дисциплины и отдельный фактчекинг. Полный текст всех трёх промтов опубликован в статье.
Нужен такой же жёсткий разбор под ваш проект
Я могу собрать тест нейросетей под вашу нишу, составить строгую рубрику оценки, проверить ответы, убрать спорные места и превратить сырой ИИ-материал в документ, который можно реально внедрять.
Обсудить задачу