Я взял девять ходовых приёмов промптинга, добавил к ним обычную инструкцию без всяких приёмов и прогнал всё это на двух задачах и трёх рабочих контурах — связках «модель плюс способ доступа к ней». Получилось 5750 вызовов, из них 5737 валидных.
На первой задаче не выиграл никто. На второй появился красивый победитель — Chain-of-Thought с результатом 0,940 против 0,620 у обычной инструкции — это доли годных ответов, здесь и дальше шкала от 0 до 1. Я почти дописал вывод про то, что рассуждение окупается там, где есть что считать.
А потом открыл сырые ответы и увидел, что победу создал не приём, а дырка в моей метрике.
Три результата за тридцать секунд
Обычная инструкция — сильный соперник. На классификации интента ни один приём не обошёл её ни на одном контуре. Лучший результат на классификации показала именно она: 0,787 у Claude.
Chain-of-Thought делает противоположное на разных моделях. Так называют просьбу к модели рассуждать вслух, прежде чем дать ответ; в таблицах ниже он сокращён до CoT. На GPT он поднял результат с 0,700 до 1,000, на локальной gemma уронил с 0,560 до 0,260. Обе разницы выдерживают поправку на множественные сравнения.
Самым устойчивым оказался few-shot. При нём в промпт вкладывают несколько готовых примеров правильного ответа. Он дал подтверждённый прирост хотя бы на одном контуре и при этом нигде не показал подтверждённого ухудшения. Но работает это при одном условии: примеры сами обязаны соблюдать то ограничение, которое требуется от ответа. С примерами от прошлой постановки задачи тот же приём становился худшим в таблице.
Зачем вообще нужны техники промптинга
Техника промптинга — это готовый шаблон формулировки запроса: попросить модель рассуждать вслух, показать ей примеры ответа, назначить роль. Все такие шаблоны выросли из одного наблюдения. Одна и та же модель отвечает на один и тот же вопрос то хорошо, то плохо, в зависимости от того, как спросили.
Разные техники чинят разные причины плохого ответа. Модель отдаёт результат не в том виде — ей жёстко задают формат. Если путается в границах задачи, ей показывают примеры. Против ошибок в подсчётах и сравнениях просят рассуждать по шагам, а роль назначают ради тона. Поэтому каталог разросся до десятков позиций: каждая техника задумана против своей болезни. Держится ли этот замысел на конкретной модели — вопрос отдельный, и ради него замер и затевался.
Беда в том, что советы о техниках почти всегда обходятся без замера. «Добавь "думай пошагово", и станет лучше» — а что именно станет лучше, на какой модели и какой ценой, в самом совете не сказано. Готового замера под свои задачи я не нашёл, поэтому сделал его сам.
Что именно я проверял
Две задачи, намеренно разные по механике.
Классификация интента поискового запроса на три класса — коммерческий, информационный, транзакционный. Эталон не выдуман под эксперимент, это ручная разметка семантического ядра моего сайта на 1810 фраз, сделанная под работу за месяцы до замера.
Генерация Title под ограничения. Здесь эталон не нужен, четыре критерия проверяются машиной. Длина не больше лимита, запрос входит в заголовок буквально, кавычек нет, точки в конце нет.
Три контура. Локальная gemma3:12b через голый API Ollama, gpt-5.6-sol через codex CLI, claude haiku через Claude Code в headless-режиме. Ни один из трёх — не окно чата: везде модель вызывается программно, одним и тем же промптом, без диалога и уточнений.
Девять приёмов против обычной инструкции:
| Приём | Что добавляется в промпт |
|---|---|
| строгий формат | запрет на пояснения, только результат |
| few-shot | шесть пар «запрос — ответ» |
| few-shot CoT | те же пары, но с показанным ходом мысли |
| contrastive CoT | плюс намеренно ошибочный разбор с объяснением ошибки |
| Chain-of-Thought | просьба рассуждать пошагово |
| Chain of Draft | то же, но не более пяти слов на шаг |
| step-back | сначала сформулировать общий принцип, потом решать |
| role prompting | роль профессионала перед задачей |
| emotion prompting | эмоциональная ставка «это важно для моей карьеры» |
Весь каталог из 54 техник я проверить не пытался. Эти девять покрывают разные механизмы влияния на ответ, от формата вывода и обучения по примерам до явного рассуждения, абстрагирования и социального давления. То есть проверялись не десять вариаций Chain-of-Thought, а несколько разных гипотез о том, почему промпт вообще может улучшить ответ.
Статистика. Доля правильных ответов и парный тест Макнемара против обычной инструкции. Все приёмы проходят одни и те же запросы, поэтому сравнивать надо расхождения на одном запросе, а не два независимых интервала. Внутри каждого контура получается семейство из четырёх-девяти сравнений, поэтому везде дальше указан p после поправки Холма. Без неё при девяти сравнениях один «значимый» результат ожидается просто по случайности. Сам p здесь — вероятность получить такую разницу случайно, когда реального эффекта нет: чем меньше, тем твёрже вывод.
Эксперимент первый: тот, которому я сначала поверил
Дальше показан первый прогон. Часть его выводов оказалась артефактами постановки, и финальным сравнением приёмов он не является. Я оставляю его в статье, потому что на нём видно, как рождается красивый неверный результат.
Классификация интента, 150 фраз на контур.
| Приём | claude haiku | gpt-5.6-sol | gemma3:12b |
|---|---|---|---|
| обычная инструкция | 0,787 | 0,700 | 0,653 |
| строгий формат | 0,747 | 0,747 | 0,700 |
| few-shot | 0,747 | 0,720 | 0,680 |
| Chain-of-Thought | 0,760 | 0,707 | 0,500 |
| Chain of Draft | 0,780 | 0,720 | 0,527 |
| role prompting | 0,753 | — | 0,687 |
| emotion prompting | 0,727 | — | 0,713 |
| step-back | 0,727 | — | 0,647 |
| few-shot CoT | 0,740 | — | 0,713 |
| contrastive CoT | 0,727 | — | 0,633 |
Ни одного подтверждённого улучшения. Точечные оценки кое-где выше обычной инструкции. У GPT строгий формат дал 0,747 против 0,700, но парный тест этого не подтверждает.
Зато подтверждаются два ухудшения, оба на слабой модели. Chain-of-Thought на gemma даёт 0,500 против 0,653 (p<0,001 после поправки), Chain of Draft даёт 0,527 (p=0,021). Модель успевает наговорить достаточно, чтобы переубедить саму себя. Оговорюсь сразу: статистически эти два эффекта внутри первого дизайна есть, но из-за дефектов, найденных позже, финальным доказательством вреда приёмов я их не считаю.
Отдельно про пару строк, которые я едва не вынес в выводы. У Claude emotion prompting и step-back проигрывают обычной инструкции с p=0,022 и p=0,035, по отдельности это читается как значимый вред. После поправки на девять сравнений остаётся 0,202 и 0,281. Никакого вреда, обычный шум.
Вторая задача: наконец-то появился победитель
Title с лимитом 60 символов дал бессмыслицу: у GPT все приёмы показали ровно 1,000. Метрика упёрлась в потолок и перестала различать что бы то ни было.
Я ужесточил лимит до 45 символов и перегнал на локальной модели. Появился результат, который просился в заголовок статьи: Chain-of-Thought 0,940 против 0,620 у обычной инструкции.
Красиво же. Заголовок надо уложить в жёсткие рамки, значит надо посчитать символы, значит рассуждение вслух наконец получило работу — и окупилось.
Я почти это написал.
Потом я открыл сырые ответы
Вот что Chain-of-Thought выдавал на самом деле:
| Запрос | Что выдала модель | Формальная проверка |
|---|---|---|
| цена продвижения сайта в топ | Цена продвижения сайта в топ | все четыре критерия пройдены |
| seo продвижение цена москва | SEO продвижение цена Москва | все четыре критерия пройдены |
| анализ семантического ядра сайта | Анализ семантического ядра сайта | все четыре критерия пройдены |
Модель выполняла формальные условия, но не решала прикладную задачу. Она возвращала сам запрос с заглавной буквы и проходила все проверки, потому что длина в норме, запрос входит целиком, кавычек нет, точки нет.
Таких ответов у Chain-of-Thought оказалось 28 из 50. У Chain of Draft — 34 из 50.
Для сравнения, few-shot на тех же самых запросах:
| Запрос | Что выдал few-shot |
|---|---|
| цена продвижения сайта в топ | Цена продвижения сайта в топ: раскрутка и SEO |
| seo продвижение цена москва | SEO продвижение цена Москва: от 5000 ₽ |
| оптимизация веб сайта | Оптимизация веб сайта: увеличение трафика |
Приём, который я собирался объявить победителем, на самом деле учил модель сдаваться. И заметил я это не из таблицы, а из сырых ответов.
Четыре ошибки моего эксперимента
Разбор каждой стоит дороже итоговых цифр: повторить их может любой, кто решит померить промпты на своих данных.
Ошибка первая: метрика принимала плохой заголовок за хороший
Требование в промпте звучало «запрос входит в Title целиком, слово в слово». А проверка искала пятибуквенные основы слов в любом порядке, слова короче трёх символов вовсе пропускала — и засчитывала «SEO ру продвижение сайтов» для запроса «seo ru продвижение сайтов».
По этой мягкой проверке Chain-of-Thought давал 0,940 и уверенно занимал первое место. Стоило потребовать буквального вхождения, как обещал промпт, и он упал до 0,720.
Один слишком добрый критерий, и центральный вывод статьи разворачивается.
Ошибка вторая: модель научилась обходить тест
Даже строгий критерий засчитывал заголовок, дословно равный запросу. Формально безупречно, практически бесполезно: такой Title нельзя поставить на страницу.
Я добавил пятое условие — заголовок должен отличаться от запроса. Таблица перевернулась: Chain-of-Thought упал с 0,720 до 0,260 и стал значимо хуже обычной инструкции.
Дальше в статье этот критерий действует везде.
Ошибка третья: few-shot учился не тому
Мои примеры в промпте были длиной 54, 49 и 51 символ, написаны под старый лимит 60. Когда лимит стал 45, я примеры не тронул.
Модель скопировала длину образца вместо того, чтобы прочитать требование. В разбивке по критериям запрос на месте в 96% заголовков, а требование длины выполняют лишь 24% ответов — рушится именно длина. Приём выглядел худшим в таблице, хотя проверялся не приём, а мой устаревший промпт.
Ошибка четвёртая: парсер сам создавал провал
Самая обидная. У коротких ответов вердикт стоит первым словом, у Chain-of-Thought — последней строкой, после того как модель вслух перебрала все три класса. Мой универсальный парсер брал последнее упоминание класса.
В результате Chain-of-Thought у Claude показывал 0,167 вместо честных 0,760 из таблицы выше. Я успел порадоваться находке «рассуждение рушит классификацию» — и хорошо, что полез в сырые ответы раньше, чем в текст статьи.
Все четыре ошибки объединяет одно. Ни одну не видно в таблице результатов. Цифры выглядят правдоподобно, тест считается, интервалы рисуются.
К этому моменту эксперимент перестал быть для меня исследованием промптинга. Он стал исследованием измерительного пайплайна: метрика, парсер и примеры влияли на вывод не меньше самого промпта.
Эксперимент второй: выровненный прогон
Вот эти результаты я считаю основными.
Что переделал. Формат вывода стал единым во всех условиях, меняется ровно одна добавка. Раньше обычная инструкция не получала требования вывести только заголовок, а почти все приёмы получали, и я сравнивал форматы, а не приёмы. Примеры пересобраны под текущий лимит. Критерий годности включает пятое условие. Параметры генерации пишутся в каждую запись результата.
| Контур | Обычная инструкция | few-shot | CoT |
|---|---|---|---|
| claude haiku | 0,980 | 0,980 (p=1,000) | 0,920 (p=0,750) |
| gpt-5.6-sol | 0,700 | 1,000 (p<0,001) | 1,000 (p<0,001) |
| gemma3:12b | 0,560 | 0,760 (p=0,154) | 0,260 (p=0,016) |
Chain-of-Thought дал +30 пунктов на GPT (с 0,700 до 1,000; пункт — сотая доля шкалы), −30 на gemma и ничего доказуемого на Claude. Поэтому вопрос «работает ли Chain-of-Thought» поставлен неправильно. Правильный вопрос звучит так: работает ли он на этой модели, на этой задаче и при этой метрике.
Про few-shot придётся сказать аккуратнее, чем хотелось бы. На GPT он дал прирост, который выдерживает поправку. На gemma прирост есть и по величине приличный — 0,760 против 0,560, — но в семействе из семи сравнений поправка Холма оставляет p=0,154. Это не доказательство. Честная формулировка: few-shot выиграл подтверждённо на одном контуре из трёх и нигде не проиграл подтверждённо. Этим он и отличается от остальных, а не размером прироста.
Механику видно по вырожденным ответам.
У GPT обычная инструкция скатывается в повтор запроса в 15 случаях из 50, отсюда её 0,700. Дали примеры или попросили рассуждение, и таких ответов не осталось вовсе. У gemma всё наоборот: повтор провоцирует именно Chain-of-Thought.
Значит склонность сдаться — свойство связки модели с промптом, а не отдельного приёма.
Модель может пройти тест, не решив задачу
Это наблюдение выходит далеко за пределы промптинга, и ради него, пожалуй, стоило всё затевать.
Если проверка допускает вырожденное решение — формально проходной, но бесполезный ответ, — модель вполне может выдать именно его вместо того, что человек считает хорошим ответом. Никакого умысла тут нет и знания о моей проверке у модели тоже: повтор запроса просто удовлетворяет всем четырём критериям и не требует ни одного решения.
Для тех, кто строит пайплайны на языковых моделях, evals и агентов, вывод простой. Формальная метрика может допускать вырожденное решение, которого вы не предусмотрели, и найти его часто получается только в сырых ответах. Автоматический счётчик покажет успех.
Проверьте, как выглядит самый дешёвый способ пройти вашу проверку. Если он не совпадает с решением задачи, чинить надо метрику, а не радоваться цифрам.
Сколько стоит дополнительное рассуждение
На первом прогоне классификации у локальной модели я мог считать ещё и токены — это единственный контур со счётчиком.
Цена в токенах — свойство самого промпта, дефекты метрики на неё не влияют. А вот точность в этой таблице взята из первого прогона, поэтому читайте её как иллюстрацию, а не как итог.
| Приём | Точность | Токенов на вызов, вход и выход | Дороже обычной инструкции |
|---|---|---|---|
| step-back | 0,647 | 407 | 3,4× |
| Chain-of-Thought | 0,500 | 282 | 2,3× |
| few-shot CoT | 0,713 | 247 | 2,0× |
| few-shot | 0,680 | 245 | 2,0× |
| contrastive CoT | 0,633 | 216 | 1,8× |
| Chain of Draft | 0,527 | 182 | 1,5× |
| role prompting | 0,687 | 156 | 1,3× |
| emotion prompting | 0,713 | 150 | 1,2× |
| строгий формат | 0,700 | 135 | 1,1× |
| обычная инструкция | 0,653 | 121 | 1,0× |
Верхние две строки показывают отрицательную окупаемость. Step-back стоит в 3,4 раза дороже и по времени тянет 1294 секунды против 375, а точность даёт ниже. Chain-of-Thought в том прогоне оказался одновременно в 2,3 раза дороже и на пятнадцать пунктов хуже — хотя сам эффект, как оговорено выше, за пределы дефектного дизайна я не переношу.
Куда уходят ошибки в классификации
Матрица построена по фразам. Для каждой взят ответ большинства из всех контуров и приёмов, иначе одна фраза весила бы 25 наблюдений — по числу связок «контур × приём».
Транзакционный класс разваливается в обе стороны: верно распознан только 61% его фраз. Ошибки системные, и сменой формулировки промпта они не лечатся, потому что упираются в размытость границы между классами.
Контуры при этом ошибаются согласованно: Claude и GPT сходятся в 80,4% случаев, каппа Коэна — 0,703 (мера согласия сверх случайных совпадений). Это выше, чем попадание каждого из них в мою разметку: 0,787 и 0,700.
Потому что часть потолка создаёт сам эталон. Фраз, где ответ большинства разошёлся с моей меткой, набралось девять из ста пятидесяти. Вот три характерных:
| Запрос | Моя метка | Ответ большинства |
|---|---|---|
| сервисы раскрутки сайтов | транзакционный | коммерческий (24 из 25) |
| семантическое ядро для автосервиса | транзакционный | информационный (16 из 25) |
| анализ сайта оптимизация | транзакционный | коммерческий (18 из 25) |
Тут спорна моя разметка, а не модели. Я разносил фразы по посадочным страницам, и в спорных случаях решала структура сайта, а не намерение пользователя. Промпт спрашивает у модели одно, а эталон местами кодирует другое — без слепой переразметки вторым человеком этот потолок не сдвинуть.
Если вы просто пользуетесь ChatGPT, Claude или Gemini
Всё выше — методология и цифры для тех, кто промпты меряет. Если вы просто печатаете вопрос в чат и хотите с первого раза получить рабочий ответ, из этого замера следует шесть вещей. Оговорка: сам чат — четвёртый контур, его я не мерил, так что ниже перенос выводов, а не прямые цифры.
- Не пишите «думай пошагово» на автомате. В моём замере один и тот же приём дал +30 пунктов точности на одной модели и −30 на другой. Это не универсальный тумблер «стань умнее», а инструмент, который иногда включает более длинный ответ вместо более точного.
- Хороший пример часто сильнее умной инструкции — но только свежий. Few-shot оказался самым устойчивым приёмом всего замера. Он же стал одним из худших, когда я подсунул модели примеры от прошлой версии задачи: результат упал до 0,220 против 0,760 у тех же условий с актуальными примерами. Если даёте модели образец, проверьте, что он сам соответствует тому, что вы просите на выходе.
- Роль «эксперта с 30-летним опытом» не поднимает точность. Role prompting и эмоциональные ставки вроде «это очень важно для моей карьеры» не дали устойчивого выигрыша ни на одном контуре. Роль может задать тон и словарь ответа. Но фраза «ты лучший юрист в мире» не делает ответ более верным.
- Если ответ плохой, не накидывайте новый приём — проверьте, понятна ли задача. Чаще всего промпт чинит не техника, а формулировка: что сделать, вот исходные данные, вот ограничения, вот пример хорошего результата.
- Иногда быстрее сменить модель, чем час подбирать формулировку. Один и тот же приём в моём замере поднимал точность на одной модели и топил на другой: Chain-of-Thought дал +30 пунктов на GPT и −30 на локальной gemma при одинаковой формулировке. Если промпт не работает, возможно, дело не в промпте.
- Смотрите в сам ответ, а не в галочки требований. В моём эксперименте модель проходила все четыре формальных условия по Title, просто возвращая заголовок, равный исходному запросу. Формально — верно. По смыслу — брак.
Рабочая формула для обычного диалога: задача → контекст → ограничения → пример → проверка результата своими глазами. Роль, «думай пошагово» и эмоциональные ставки в неё не входят: этот замер не даёт оснований считать, что они влияют на точность.
«Ты профессиональный копирайтер с 20-летним опытом. Напиши текст про эпиляцию для клиники. Думай пошагово и используй лучшие мировые практики.»
«Напиши описание услуги лазерной эпиляции для сайта клиники. Аудитория — женщины 25–40, пришли из поиска. 800–900 знаков, без "у нас лучшие цены". Обязательно укажи: сколько нужно процедур, есть ли противопоказания. Вот два текста с сайта в похожем тоне — держись его: [тексты-образцы]».
Не копите «волшебные промпты». Раз эффект приёма скачет между моделями и задачами, ритуальные фразы вроде «ты — эксперт в…», «думай пошагово», «это очень важно», «сначала задай уточняющие вопросы», «оцени свой ответ от 1 до 10» не гарантируют ничего. Полезнее держать хороший прошлый результат как шаблон и короткий список требований под свою повторяющуюся задачу, чем коллекцию заклинаний. Из тех же шести пунктов выше собран генератор промптов: можно не запоминать формулу, а просто заполнить поля.
И диалог в чате можно вести итеративно. Этот эксперимент не отменяет обычную переписку. Я тестировал промпты с одной попытки, потому что иначе результаты было бы не с чем сравнивать. В обычном чате так делать не нужно: «сократи», «убери рекламный тон», «здесь ты не так понял» — рабочий способ довести ответ до нужного вида, а не нарушение методологии.
Как тестировать промпт, чтобы не обмануть самого себя
Порядок важнее списка. Каждый следующий шаг бессмысленно делать раньше предыдущего.
- Проверьте метрику. Найдите самый дешёвый способ её пройти. Если он не решает задачу — чините метрику.
- Посмотрите сырые ответы. Хотя бы два десятка, глазами, а для парсера — рядом с тем, что он из них извлёк. Все четыре мои ошибки нашлись именно так, ни одна не была видна в таблице.
- Сначала зафиксируйте модель. Эффект одного и того же приёма меняет знак между контурами: тот же Chain-of-Thought дал +30 пунктов, −30 и почти ноль. Переносить «лучший промпт» с одной модели на другую нельзя.
- Зафиксируйте точку отсчёта — обычную инструкцию без приёмов. В моём замере она оказалась сильнее большинства приёмов. Пока её нет, сравнивать не с чем.
- Меняйте одну вещь за раз. Иначе сравните формат вывода, а не приём — именно на этом я и погорел в первом заходе.
- И только потом пробуйте few-shot, Chain-of-Thought и остальное. Примеры обязаны сами соблюдать те требования, которые вы предъявляете к ответу.
Отдельно про роль и эмоции. Не рассчитывайте на них как на способ повысить точность. Устойчивого выигрыша они не дали ни на одном контуре, а видимый вред от emotion prompting у Claude не пережил поправку на множественные сравнения. Для тона они работают, для точности — нет.
Правила из этого замера я вшил в генератор промптов — он собирает промпт под тип задачи и разбирает готовый, показывая, какой дефект чего стоит. Работает в браузере, промпт никуда не отправляется.
Чего этот замер не показывает
Две задачи, три контура, русский язык, один сайт, один разметчик. За рамками остались длинный контекст, агентные цепочки, генерация связного текста, английский язык и ансамблевые приёмы вроде Self-Consistency — они требуют N прогонов на задачу и отдельного бюджета.
Жёсткий вариант второй задачи — разведочный анализ, а не подтверждающий тест. Лимит 45 я выбрал после того, как увидел потолок на лимите 60, на тех же пятидесяти запросах. Гипотезу про приёмы на жёстком лимите надо перепроверять на новой выборке с заранее зафиксированными промптами.
Дизайн неполный. У GPT в первой задаче прогнано только пять условий из десяти, считая обычную инструкцию; полный набор из восьми условий во второй задаче прогонялся только на локальной модели. Параметры генерации в первых прогонах фиксировались не везде — температура ноль уходила только в Ollama. И ещё одно: выравнивание второго прогона коснулось только задачи с Title, классификацию я не перепрогонял. Вывод про обычную инструкцию на классификации опирается на первый прогон после починки парсера.
И главное ограничение, которое стоит держать в голове при чтении любых таблиц, включая мои. Полторы сотни фраз дают доверительный интервал шириной около четырнадцати пунктов. Разница в три пункта между приёмами на такой выборке не значит ничего, а в подборках, где «техника X даёт +12% к качеству», интервалов не бывает вовсе.
Что в итоге
Сведу баланс. Помощь от техник в этом замере точечная. Chain-of-Thought дал плюс тридцать пунктов на GPT и минус тридцать на gemma. Few-shot — единственный приём, который где-то выиграл по правилам замера и нигде по ним не провалился. Роль, эмоциональные ставки и остальные приёмы прироста, выдержавшего поправку, не показали ни на одном контуре.
А платить приходится всегда. Каждый приём удлиняет промпт и ответ, и вы платите за это токенами и временем независимо от того, сработал он или нет. На единственном контуре, где токены поддавались счёту, step-back обошёлся в 3,4 раза дороже обычной инструкции при точности ниже неё. В чате эту цену прячет подписка, в API она приходит счётом.
Отсюда моё правило. По умолчанию — обычная инструкция с ясной задачей, форматом и критерием приёмки: она дешевле любого приёма и оказалась сильнее большинства из них. Техника подключается после замера на вашей модели и вашей задаче — когда прирост держится на повторном прогоне, переживает поправку и окупает наценку. Первый кандидат на такой замер — few-shot со свежими примерами.
Самая дорогая ошибка в этом эксперименте была не в выборе приёма. Она была в уверенности, что метрика измеряет то, что написано в постановке задачи.
Частые вопросы
Задайте формат ответа, опишите спорные случаи и критерий приёмки. Примеры давайте только такие, которые сами соблюдают требования задачи: в этом замере устаревшие образцы уронили результат до 0,220 против 0,760 у тех же условий с корректными.
Рабочий минимум — задача, определения спорных случаев, формат вывода и критерий приёмки. Роль и эмоциональные приписки в структуру не входят: на точность они не влияют, а место занимают. Собрать промпт по такой структуре можно в генераторе промптов.
Универсальной нет, и это главный результат замера. Chain-of-Thought на одной модели дал +30 пунктов, на другой −30, на третьей не изменил ничего. Самым устойчивым оказался few-shot, но только с примерами, соблюдающими требования задачи.
Помогают, когда сами соответствуют ограничениям. Если пример нарушает требование, которое вы предъявляете к ответу, модель скопирует параметры примера, а не прочитает требование — так few-shot из лучшего приёма превратился в худший.
Нормативно — промпт, от английского prompt. Форма «промт» с одной «т» встречается в русскоязычных сообществах чаще, но грамотной не является.
По моему замеру — не формулировка, а метрика и примеры. Четыре ошибки, которые я нашёл у себя: мягкий критерий приёмки, вырожденный ответ, проходящий проверку, устаревшие примеры и парсер, который неверно доставал ответ.
Данные и воспроизводимость
Каталог из 54 приёмов с источниками, границами применимости и колонкой «где ломается» — отдельной страницей. Скрипты замера, сырые ответы и процедура пересчёта сохранены: любую цифру из статьи можно пересобрать из логов одной командой. Нужен архив — напишите в комментариях или в телеграме, отдам.
Что читать дальше по теме измерений. В разборе способов считать трафик из нейросетей тот же подход применён к AI-видимости. В исследовании AI-детекторов разобрано, что эти инструменты измеряют на самом деле. А сравнение моделей по человечности текста показывает, насколько по-разному ведут себя модели на одной задаче — ровно то, что подтвердилось и здесь.