生成AIの文章作成能力を実測比較|AIっぽさはモデル差か、書く前の設計差か

生成AIの文章は、モデルを変えれば自然になるのでしょうか。それとも、書く前の設計を細かくすれば品質は上がるのでしょうか。HSビルではGPT-6 AstraとClaude Opus 5を対象に、同じ素材を使い、最小限の指示で書かせる条件と、読者・判断・構成まで設計した条件を各3回、合計12回比較しました。
結論は、どちらか一方ではありませんでした。事前設計は文章の構造や読みやすさを改善しましたが、素材にない因果や現場行動まで補う「事実忠実性」の問題は別に残りました。 企業が生成AIの文章をWeb、提案資料、社内文書へ使うなら、モデル選択だけでも、プロンプト改善だけでも不十分です。今回の検証からは、モデル選択 → 書く前の設計 → 事実照合 → 編集・承認の4工程に分けて管理する方が実務的だと判断しています。
HS FIRSTHAND TEST 本記事は、HSビルが2026年9月15日に実施した自社検証をもとにしています。単一テーマ・2モデル・各条件3回の比較であり、生成AI全体の日本語能力ランキングを示すものではありません。
この記事で分かること
生成AIの「モデル差」と「書く前の設計差」をどう分けて見るべきか
事前設計で改善した部分と、改善しなかった部分
「自然で読みやすい文章」と「素材に忠実な文章」が同じではない理由
企業がAI文章を公開・納品する前に置くべき4つの品質管理工程
有料の生成AI研修が必要な会社と、操作学習や自習で足りる会社の違い
30秒で分かる結果
今回の固定条件では、設計を細かくすると構造面の評価は上がりました。しかし、厳格な素材忠実性まで一律に改善したわけではありません。 ここを一つの総合点にまとめると、企業が本当に知りたい「そのまま公開できるか」が見えにくくなります。
モデル | Codex厳格評価 A | Codex厳格評価 B | B-A | 未提示情報フラグ A | 未提示情報フラグ B | 今回の読み方 |
GPT-6 Astra | 88.67 | 89.67 | +1.00 | 0/3 | 0/3 | 今回の条件では素材忠実性が安定 |
Claude Opus 5 | 84.00 | 82.00 | -2.00 | 2/3 | 3/3 | 構造は整う一方、厳格評価では補足推論が減点対象に |

一方、構造・読みやすさを重視したClaude評価では、AからBへの改善幅はAstraが+9.33、Opus 5が+6.00でした。
ここで重要なのは、Codex評価とClaude評価を足して「総合優勝」を決めないことです。評価者が見ているものが違うからです。今回の検証では、その不一致自体が「企業は読みやすさと事実忠実性を別々に確認すべき」という発見につながりました。
検証方法|同じ素材で「Raw」と「Designed」を分けた
今回の確認試験では、テーマを「中小企業の生成AI研修は『AIの操作説明』だけで十分か」に固定しました。素材も固定し、外部検索を使わせず、素材にない数字・事例・価格・成果・出典を追加しないよう指示しています。
比較した条件は2つです。
条件 | 指示の考え方 | 目的 |
Task A:Raw | 同じ素材だけを渡し、記事作成の最低限の制約を指定 | モデルが自力でどう構成するかを見る |
Task B:Designed | 読者、疑問、読後の判断、書かない情報、残す事実、セクションの重みまで指定 | 書く前の設計が品質へ与える影響を見る |
GPT-6 AstraとClaude Opus 5で、Aを3回、Bを3回ずつ実施しました。合計12出力です。各回は別の新規チャットとし、前の出力を参照させていません。Web検索・外部調査は使わず、最初の出力をそのまま保存しました。条件に合わないからといって再生成したり、良い出力だけを選んだりしていません。
文字数条件は1,200〜1,800字とし、今回の12出力はすべてこのゲートを通過しました。ただし、文字数を満たしたことは品質を満たしたことと同義ではありません。 文章の自然さ、可読性、構造、具体情報の保持、指示遵守、素材にない追加、人手編集負荷などを分けて見ています。
書く前に設計すると、構造と判断導線は改善した
今回の結果では、事前設計は「何を、どの順番で、どの厚さで書くか」をそろえるのに有効でした。 読者と読後の判断を固定したB条件では、Answer First、判断表、無料動画や自習で足りるケース、業務判断型研修が必要なケース、最後の判断チェックが明確になりました。
構造・読みやすさを中心に見たClaude評価では、AからBへの改善幅は次の通りです。
モデル | Claude構造・スタイル評価 A | B | B-A |
GPT-6 Astra | 80.33 | 89.67 | +9.33 |
Claude Opus 5 | 87.00 | 93.00 | +6.00 |
この結果から言えるのは、「設計すれば必ず良い文章になる」ではありません。より限定すると、読者・判断・残す情報・構成の重みを先に固定すると、少なくとも今回の課題では、読み手が判断しやすい形へ整える効果が見えたということです。
企業の文章制作で応用するなら、「長めに詳しく書いて」ではなく、最低でも次を生成前に固定する方が扱いやすくなります。
誰が読むのか
読後に何を一つ判断できればよいのか
使ってよい素材は何か
書いてはいけない情報は何か
最も厚く扱う論点は何か
最後にどの行動へつなぐのか
これは、派手なプロンプト技法というより編集設計です。
しかし、事実忠実性は別問題だった
読みやすく整った文章でも、素材にない説明が混ざればB2B公開では修正が必要です。 今回、厳格にSOURCE PACKとの対応を見たCodex評価では、設計を入れたB条件が必ずしも高くなりませんでした。
Codex厳格評価の平均は、Astraが88.67から89.67へ+1.00。Opus 5は84.00から82.00へ-2.00でした。さらに、素材にない因果・行動・一般化の追加としてフラグされた出力数は、AstraがA/Bとも0/3、Opus 5がAで2/3、Bで3/3でした。
たとえば、元の素材には「入力してよい情報・いけない情報を整理する」としかないのに、出力側で「ルールがないと社員が慎重になって使わないか、各自の判断で使う」といった社員行動まで補う。あるいは「自社業務のどこで使うかは動画を見ても決まりません」と断定する。文章としては自然でも、固定素材だけで書くという今回の条件では、こうした補足は未提示情報として扱いました。
ここには重要な実務差があります。自然な補足と根拠のある補足は同じではありません。
企業サイト、営業資料、採用資料、顧客向け説明などでは、この差を無視できません。文章が読みやすいほど、追加された推論も自然に見えるためです。そこで必要なのは、「AIがうまく書けたか」だけを読む編集ではなく、数値、因果、人物行動、事例、成果、比較断定を元資料へ戻して確認する工程です。
評価AIでも判定が割れた|「文章力」は一つの点数ではない
今回、同じ文章を見ても、評価軸によって順位が変わりました。 Claude側は見出し、一覧性、判断導線などを高く評価し、Codex側は固定素材にない因果や行動を強く減点しました。
これは「どちらの評価AIが正しいか」という話ではありません。むしろ、企業が「文章力」という一語に複数の評価軸を混ぜる危険を示しています。
少なくとも次は分けて見る必要があります。
日本語として自然か
読みやすいか
全体構造が分かりやすいか
必要な具体情報を落としていないか
指示に従っているか
与えていない事実を足していないか
人間が直す量は多いか少ないか
見た目が整っている文章をそのまま高品質とみなすと、事実規律が抜けます。逆に、素材に忠実なだけで読者が判断できない文章も、そのままでは公開品質とは言いにくい。HSビルでは今回の結果から、「文章のうまさ」と「公開可能性」を同じ評価にしない方針を取ります。
今回のモデル差をどう読むべきか
今回の固定条件では、Astraの方が素材にない追加を抑える点で安定していました。ただし、これを「AstraはOpus 5より日本語文章が優れている」と一般化することはできません。
理由は明確です。
テーマは1つだけ
確認対象は2モデル
各モデル・各条件3回
ChatGPT/Claudeの製品面を含む体験であり、純粋なベースモデルAPIだけの比較ではない
評価者にも主観と評価軸の違いがある
統計的有意差を検定した試験ではない
今回の結果は、「どのAIが最強か」を決めるランキングではなく、自社の固定素材と固定ルールで、実務上必要な性質を確かめる方がよいという判断材料です。
広報文なら自然さを重く見ることができます。価格や規約、商品仕様を扱う文章なら、勝手な補足をしないことの比重が上がります。Web記事では、検索意図に答えながら、一次情報と自社判断を分離する必要があります。つまり、モデル選びも「日本語がうまいAIはどれか」ではなく、自社の仕事で何を失敗してほしくないかから決める方が実務的です。
企業が採用すべき4工程
今回の検証から、生成AI文章を業務へ入れる際は、生成そのものより前後の工程を分ける必要があると判断しました。 HSビルでは、次の4段階で考えます。

工程 | 決めること | 主な確認 |
1. モデル選択 | 自社業務で避けたい失敗に合うか | 読みやすさと忠実性を別評価 |
2. Pre-writing Design | 読者、判断、素材、禁止事項、構成 | 書く前に情報の境界を固定 |
3. Factual Gate | 数値、因果、行動、事例、成果 | SOURCE PACKへ戻って照合 |
4. Editorial Review | 読みやすさ、判断導線、CTA、公開可否 | 人が最終承認 |
1. モデル選択
モデル名や外部ランキングだけで決めず、自社の実際の素材を使って比較します。「自然さ」と「勝手に足さない」を別項目にすると、用途ごとの向き不向きが見えやすくなります。
2. 書く前の設計
読者、読後の判断、使ってよい素材、使わない素材、最も厚くする論点を固定します。情報を増やすより、何を削るか、何を固定するかが重要です。
3. 事実ゲート
生成後に、最低でも数値・因果・人物や社員の行動・事例・成果・比較断定を確認します。AIが付け足した「もっともらしい説明」を、そのまま事実にしません。
4. 編集・承認
最後に、人間が読みやすさ、論点の強弱、CTAとのつながり、公開可否を見ます。機械チェックはフラグを出す役割に寄せ、文章全体を自動で書き直して元の具体性を消さないようにします。
この4工程のどこまでを自動化するかは、業務ごとに変わります。少なくとも「生成したら完成」ではなく、生成と公開の間に確認責任を置くことが前提です。
コストと運用上のトレードオフ
品質ゲートを増やせば確認作業も増えます。今回の試験は、その工数が何分減るか、ROIがいくら改善するかを測定したものではありません。 したがって「4工程にすれば必ず生産性が上がる」とは言えません。
逆に、すべての文章へ重い審査を入れる必要もありません。社内メモの下書きと、外部公開する商品説明ではリスクが違います。用途に応じて、確認の深さを変える方が現実的です。
社内の低リスク下書き:簡易確認
顧客向け文章:事実・表現を確認
価格・規約・契約・安全に関わる文章:より厳格な根拠確認
Web公開記事:事実、検索意図、E-E-A-T、CTA、構造化データまで確認
重要なのは、AIを使うか使わないかではなく、どの文章を、どの品質ゲートまで通すかを決めることです。
No-Go / Wait|やらない方がよい運用
今回の実測から、少なくとも「文章が整って見えるから公開する」はNo-Goです。 また、モデル名だけ、プロンプトだけ、AI detectorだけの一要素で品質を決めるのも避けます。
No-Go 1:モデルを変えれば解決すると考える
モデル差はありました。しかし、同じモデルでも指示条件で構造が変わっています。モデル選択だけで制作工程の問題は解決しません。
No-Go 2:プロンプトを細かくすれば安全だと考える
設計を細かくすると構造は整いましたが、今回のOpus 5では未提示情報フラグが減りませんでした。設計と事実確認は別工程にする必要があります。
No-Go 3:「AIっぽさ」の検出だけを目的にする
今回の試験はAI detectorの点数を競っていません。人間らしく見える文章に変えることより、読者が判断でき、根拠を追え、必要な確認が終わっていることを優先します。
この結果はプロンプトに依存しただけではないか
その可能性は残ります。今回の設計条件、素材、テーマ、評価基準に対する適合性が結果へ影響した可能性はあります。そのため、本記事では「事前設計は常にモデル差より大きい」とは結論づけません。
むしろ企業側で再現すべきなのは、今回の順位ではなく、自社の素材でA/Bを行い、評価軸を分ける方法です。
モデルを変える前の判断チェック
次の項目に「いいえ」がある場合、まずモデル変更より制作工程を見直す余地があります。
読者が誰か決まっている
読後に何を判断してほしいか一つに絞れている
AIへ渡してよい素材が固定されている
書いてはいけない数字・事例・成果・推測が決まっている
最も厚く書く論点が決まっている
数値、因果、人物行動、事例、成果を元資料と照合している
読みやすさと事実忠実性を別々に見ている
公開前に最終承認する人が決まっている
すべて整っているのに品質が安定しないなら、その時点で同じ素材・同じ評価軸を使ってモデルを比較する方が、モデル名だけで選ぶより判断しやすくなります。
FAQ
Q1. AI文章はプロンプトを詳しくすれば自然になりますか?
今回の試験では、読者・判断・構成まで設計した条件で、構造・読みやすさの評価は改善しました。ただし、素材にない補足まで減るとは限りませんでした。自然さを上げる設計と、事実を守る確認は分けて考える必要があります。
Q2. GPT-6 Astraの方がClaude Opus 5より文章作成に強いのですか?
今回の固定課題では、Astraの方がSOURCE PACK外の追加を抑える点で安定しました。一方、これは1テーマ・各条件3回の確認試験です。一般的な日本語文章力や全用途の優劣を示す結果ではありません。
Q3. 「AIっぽい文章」を減らすには何から直せばよいですか?
モデル変更の前に、読者、読後の判断、使える素材、禁止事項、構成の重みを固定します。その後、生成文の数値・因果・人物行動・事例・成果を元資料と照合します。「自然にして」とだけ指示するより、編集工程を分ける方が確認しやすくなります。
Q4. AI detectorで人間らしさを確認すれば十分ですか?
本検証ではAI detectorを品質基準にしていません。企業実務では、誰が読んで何を判断する文章か、根拠が確認できるか、人が最終承認したかを優先する方針です。
Q5. すべての会社に有料の生成AI研修が必要ですか?
必要とは限りません。操作方法だけが課題で、自社で対象業務や入力ルール、人の確認ポイントを決められる場合は、無料動画や自習で足りる企業もあります。一方、自社の実在業務で何を試し、どこを人が確認するかまで整理したい場合は、業務判断型の研修を検討する余地があります。目的・対象業務・責任者自体が曖昧なら、研修より業務設計が先です。
自社業務に合わせた生成AI研修が向くかを確認する
今回の内容は、操作方法を覚えるためだけの研修を勧めるものではありません。
向いている可能性がある企業
ChatGPT等は触っているが、社内文章・Web・提案資料の品質基準がそろっていない
AIへ渡す素材の範囲や、入力してよい情報・いけない情報を整理したい
AIの出力を人がどこで確認するか決めたい
自社の実在業務を使って、次に試す業務を決めたい
操作学習や自習で足りる可能性がある企業
AIを使う目的、対象業務、責任者が明確
入力情報ルールと人の確認ポイントを自社で決められる
残る課題がツールの操作方法だけ
HSの法人研修設計では、10名を標準想定とし、事前30分のヒアリング、資料・テンプレートを含み、全国オンラインに対応しています。実務型では、自社の実在業務から3〜5件を候補として扱い、研修後に翌週試す1業務または1アクションを決める設計があります。
研修による売上増加や生産性向上を保証するものではありません。
公式一次情報・参考資料
HSビル自社一次検証「Astra vs Opus5|A/B fresh-chat n=3確認試験」
実施日:2026-09-15
使用論点:12回のA/B比較、評価平均、未提示情報フラグ、評価者間の差
備考:HSビル内部検証ログ。本文では単一テーマ・少数試行の制約を明示
関連記事
HSビル・ワーキングスペース 基本情報
項目 | 内容 |
施設名 | HSビル・ワーキングスペース |
運営会社 | FULMiRA Japan 合同会社 |
代表者 | 三宅 悠生 |
所在地 | 奈良県奈良市西大寺北町1丁目2-4 ハッピースクールビル |
事業者住所 | 〒631-0817 奈良県奈良市西大寺北町1-2-4 HSビル1階 |
最寄駅 | 近鉄「大和西大寺駅」北口 徒歩4分 |
営業時間 | 8:00〜23:00 / 年中無休 |
電話番号 | 0742-51-7830 |
メール | hsbuild.m@gmail.com |
公式サイト | https://www.hsworking.com/ |
主なサービス | コワーキングスペース、個室ブース、貸し会議室、バーチャルオフィス、AI活用・AI導入支援 |
HSビル・ワーキングスペースは、奈良・大和西大寺エリアで、コワーキングスペース、個室ブース、貸し会議室、バーチャルオフィスを運営しながら、自社業務でAI・SEO/AIO・Wix・LINE導線の実運用を行っています。所在地、営業時間、連絡先、運営会社情報は公式サイトでも確認できます。
筆者プロフィール
筆者:三宅 悠生
三宅 悠生(みやけ ゆうき)。FULMiRA Japan合同会社代表。奈良・大和西大寺のHSビル・ワーキングスペースを運営し、AIスタッフ運用・SEO/AIO・業務のAI設計を実務で実践している。


コメント